SREGym: Can AI agents resolve production issues? Real-world SRE problems including metastable failures, misconfigurations, and many more. Live system environments. From the University of Illinois at Urbana-Champaign. To submit, open an issue with the submission label at github.com/SREGym/SREGym.

SREGym-Lite results

Top results on curated 21-fault cohort.

1
Codex
OpenAI
GPT-5.6 Sol (max)
95.285.781.0211.0397.01.42M
2
Claude Code
Claude
Claude Opus 5
92.182.576.2210.1419.81.64M
3
Codex
OpenAI
GPT-5.6 Terra (max)
85.779.469.8214.7415.81.68M
4
Codex
OpenAI
GPT-5.6 Luna (max)
87.379.468.3284.0492.92.74M
5
Codex
OpenAI
GPT-5.6 Sol (medium)
77.871.458.7108.2270.60.77M

Diag. Diagnosis success rate · Mit. Mitigation success rate · E2E End-to-end (both diagnosis and mitigation correct) · TTD Time-to-diagnose (seconds) · TTM Time-to-mitigate (seconds) · Tokens Mean token usage per run

view all results ↗