MageBench Season 1 — leaderboard

MageBench Season 1 evaluates model capability on games & game agents tasks from the linked upstream source with Rating as the primary reported metric.

Metric: Rating (self-reported). Source: benchmarklist.com. Status: saturation imminent. 35 models tracked.

Top models

#ModelScore
1Claude Opus 4.6 (Medium)1747
2GPT-5.2 (Medium)1737
3DeepSeek V3.21682
4GPT-5.4 (Medium)1658
5Gemini 3 Flash (Preview) (Medium)1622
6O3 (Medium)1609
7Qwen 3 235B A22B1594
8Llama 4 Maverick1590
9Gemini 3.1 Flash Lite1578
10GPT-5.21547
11GPT-4o Mini1546
12GPT-5 (Medium)1536
13GPT-5 Mini (Medium)1516
14Mistral Large1501
15GPT-5 Nano (Low)1499

Interactive version: theaggregate.ai/benchmark?slug=magebench-season-1 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.