EnterpriseOps-Gym-AA - Email: leaderboard

Metric: Task Success (%). Source: artificialanalysis.ai. 48 models tracked.

Top models

#ModelScore
1Qwen 3.7 Max69.87
2Kimi K3 (Max)68.59
3Qwen 3.8 27B (xHigh)67.31
4Gemini 3.7 Flash (Medium)67.31
5Muse Spark 1.2 (xHigh)66.35
6Gemini 3.5 Flash (High)66.03
7Claude Sonnet 5 (Adaptive Reasoning, Max Effort)65.38
8Mistral Medium 3.564.1
9Gemini 3.1 Pro (Preview)63.78
10Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort)63.78
11Qwen 3.7 Plus62.5
12Inkling (xHigh)62.5
13Qwen 3.5 397B A17B (Reasoning)62.18
14Gemini 3.5 Flash Lite61.54
15GPT-5.5 (Medium)61.54

Interactive version: theaggregate.ai/benchmark?slug=enterpriseops-gym-aa-email · How It Works · Data refreshed daily, snapshot 2026-09-19.