EnterpriseOps-Gym-AA - HR: leaderboard

Metric: Task Success (%). Source: artificialanalysis.ai. 48 models tracked.

Top models

#ModelScore
1Grok 4.6 (High)45.65
2Gemini 3.7 Flash (Medium)44.02
3Gemini 3.5 Flash (High)42.39
4Qwen3.8 2.4T A95B42.39
5GPT-5.5 (xHigh)41.3
6Claude Opus 5 (Adaptive Reasoning, Max Effort)40.76
7GLM-5.3 (Max)40.22
8GPT-5.5 (Medium)38.77
9Muse Spark 1.2 (xHigh)37.5
10Claude Opus 4.8 (Adaptive Reasoning, Max Effort)36.96
11Qwen 3.8 27B (xHigh)36.41
12Kimi K3 (Max)35.69
13Qwen 3.7 Max35.33
14Inkling Small35.33
15GLM-5.3 Flash34.78

Interactive version: theaggregate.ai/benchmark?slug=enterpriseops-gym-aa-hr · How It Works · Data refreshed daily, snapshot 2026-09-19.