EnterpriseOps-Gym-AA - ITSM: leaderboard

Metric: Task Success (%). Source: artificialanalysis.ai. 48 models tracked.

Top models

#ModelScore
1Gemini 3.7 Flash (Medium)50.28
2Gemini 3.5 Flash (High)47.33
3Grok 4.6 (High)44.2
4Qwen3.8 2.4T A95B44.2
5Muse Spark 1.2 (xHigh)43.65
6GLM-5.3 (Max)43.09
7Claude Opus 5 (Adaptive Reasoning, Max Effort)41.44
8GPT-5.5 (xHigh)40.88
9Kimi K3 (Max)39.41
10GLM-5.3 Flash38.12
11GLM-5.2 (Max)37.94
12Qwen 3.8 27B (xHigh)37.57
13Claude Sonnet 5 (Adaptive Reasoning, Max Effort)35.91
14Claude Opus 4.8 (Adaptive Reasoning, Max Effort)35.54
15GPT-5.6 Sol (Max)34.62

Interactive version: theaggregate.ai/benchmark?slug=enterpriseops-gym-aa-itsm · How It Works · Data refreshed daily, snapshot 2026-09-19.