EnterpriseOps-Gym: leaderboard

Stateful enterprise operations benchmark for LLM agents performing long-horizon planning, tool use, and policy-governed workflows.

Metric: Task Success Rate (self-reported). Source: benchmarklist.com. Status: saturation imminent. 22 models tracked.

Top models

#ModelScore
1Claude Opus 4.644.6
2Claude Sonnet 4.640.4
3Claude Opus 4.537
4Gemini 3.1 Pro (Preview)36.6
5Gemini 3 Flash31.7
6GPT-5.2 (High)31.3
7Claude Sonnet 4.530.5
8GPT-529.2
9Gemini 3 Pro27.4
10Kimi K2.5 (Thinking)26.2
11MiniMax-M2.723
12GPT-OSS-120B (High)23
13GLM-522.2
14GPT-5 Mini20.6
15Kimi K2 (Thinking)19.2

Interactive version: theaggregate.ai/benchmark?slug=enterpriseops-gym · How It Works · Data refreshed daily, snapshot 2026-09-05.