AA GDPval: leaderboard

Artificial Analysis independent evaluation of GDPval: real-world agentic tasks across 44 occupations and 9 industries with shell/web access. ELO-rated, 220 tasks.

Metric: ELO. Source: artificialanalysis.ai. Status: years away from saturation. 238 models tracked.

Top models

#ModelScore
1Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)1769.1
2Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)1751.06
3Claude Opus 5 (Adaptive Reasoning, Max Effort)1739.24
4Muse Spark 1.3 (Max)1720.15
5Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)1713.13
6GLM-5.3 (Max)1681.03
7GLM-5.3 Flash1674.12
8Grok 4.6 (xHigh)1667.19
9Muse Spark 1.3 (xHigh)1667.1
10Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)1655.69
11Qwen3.8-Flash-Next1652.66
12Grok 4.6 (High)1647.85
13Grok 4.6 (Medium)1647.49
14Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)1636.84
15Qwen 3.8 Max1634.2

Interactive version: theaggregate.ai/benchmark?slug=aa-gdpval · How It Works · Data refreshed daily, snapshot 2026-09-05.