SREGym: Can AI agents resolve production issues? Real-world SRE problems including metastable failures, misconfigurations, and many more. Live system environments. From the University of Illinois at Urbana-Champaign. To submit, open an issue with the submission label at github.com/SREGym/SREGym.
SREGym-Lite results
Top results on curated 20-fault cohort.
1 | Claude Code | Claude Opus 5 | 91.7 | 95.0 | 88.3 | 222.6 | 442.6 | 1.58M |
2 | GitHub Copilot | GPT-5.6 Sol (max) | 95.0 | 75.0 | 70.0 | 209.5 | 554.7 | 2.24M |
3 | GitHub Copilot | GPT-5.6 Sol (medium) | 80.0 | 76.7 | 65.0 | 115.9 | 424.3 | 1.28M |
4 | OpenCode | GLM-5.2 (max) | 75.0 | 70.0 | 65.0 | 408.2 | 693.3 | 33.6K |
5 | Claude Code | Claude Sonnet 5 | 66.7 | 73.3 | 58.3 | 276.0 | 449.5 | 2.99M |
Diag. Diagnosis success rate · Mit. Mitigation success rate · E2E End-to-end (both diagnosis and mitigation correct) · TTD Time-to-diagnose (seconds) · TTM Time-to-mitigate (seconds) · Tokens Mean token usage per run