EnterpriseOps-Gym-AA - CSM: leaderboard

Metric: Task Success (%). Source: artificialanalysis.ai. 48 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol (Max)55.38
2Grok 4.6 (High)55.38
3GLM-5.3 (Max)54.84
4GPT-5.5 (xHigh)53.94
5Claude Opus 5 (Adaptive Reasoning, Max Effort)53.41
6Gemini 3.5 Flash (High)52.69
7Gemini 3.7 Flash (Medium)50.54
8GPT-5.5 (Medium)50.36
9GPT-5.6 Luna (Max)49.46
10Grok 4.5 (High)49.46
11GPT-5.6 Terra (Max)48.92
12Claude Sonnet 5 (Adaptive Reasoning, Max Effort)48.92
13Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort)48.03
14GLM-5.3 Flash47.31
15Qwen3.8 2.4T A95B47.31

Interactive version: theaggregate.ai/benchmark?slug=enterpriseops-gym-aa-csm · How It Works · Data refreshed daily, snapshot 2026-09-19.