SREGym: Can AI agents resolve production issues? Real-world SRE problems including metastable failures, misconfigurations, and many more. Live system environments. From the University of Illinois at Urbana-Champaign. To submit, open an issue with the submission label at github.com/SREGym/SREGym.

SREGym-Lite results

Top results on curated 20-fault cohort.

1
Claude Code
Claude
Claude Opus 5
91.795.088.3222.6442.61.58M
2
GitHub Copilot
OpenAI
GPT-5.6 Sol (max)
95.075.070.0209.5554.72.24M
3
GitHub Copilot
OpenAI
GPT-5.6 Sol (medium)
80.076.765.0115.9424.31.28M
4
OpenCode
Z.ai
GLM-5.2 (max)
75.070.065.0408.2693.333.6K
5
Claude Code
Claude
Claude Sonnet 5
66.773.358.3276.0449.52.99M

Diag. Diagnosis success rate · Mit. Mitigation success rate · E2E End-to-end (both diagnosis and mitigation correct) · TTD Time-to-diagnose (seconds) · TTM Time-to-mitigate (seconds) · Tokens Mean token usage per run

view all results ↗