EnterpriseOps-Gym-AA - Hybrid: leaderboard

Metric: Task Success (%). Source: artificialanalysis.ai. 48 models tracked.

Top models

#ModelScore
1Gemini 3.5 Flash (High)44.66
2Qwen 3.7 Max43.57
3Muse Spark 1.2 (xHigh)42.48
4Gemini 3.7 Flash (Medium)42.48
5Qwen 3.7 Plus41.39
6Kimi K3 (Max)41.18
7Gemini 3.5 Flash Lite41.18
8Grok 4.6 (High)39.87
9Gemini 3.1 Pro (Preview)39.65
10Mistral Medium 3.539.43
11Qwen3.8 2.4T A95B39.22
12Qwen 3.8 27B (xHigh)38.56
13GLM-5.2 (Max)38.13
14Kimi K2.7 Code37.69
15GPT-5.5 (xHigh)37.47

Interactive version: theaggregate.ai/benchmark?slug=enterpriseops-gym-aa-hybrid · How It Works · Data refreshed daily, snapshot 2026-09-19.