AA GDPval — leaderboard

Artificial Analysis independent evaluation of GDPval: real-world agentic tasks across 44 occupations and 9 industries with shell/web access. ELO-rated, 220 tasks.

Metric: ELO. Source: artificialanalysis.ai. Status: saturated. 165 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol (Max)1736.24
2GPT-5.6 Sol (xHigh)1702.21
3Kimi K31679.21
4GPT-5.6 Sol (High)1630.29
5Claude Sonnet 5 (Adaptive Reasoning, Max Effort)1607
6Claude Opus 4.8 (Adaptive Reasoning, Max Effort)1593.63
7GPT-5.6 Luna (Max)1584
8GPT-5.6 Terra (Max)1581.23
9GPT-5.6 Terra (xHigh)1571.97
10GPT-5.6 Sol (Medium)1561.65
11GPT-5.6 Luna (xHigh)1539.11
12Grok 4.5 (High)1535
13GLM-5.2 (Max)1513.89
14GPT-5.6 Terra (High)1512.84
15Claude Opus 4.7 (Adaptive Reasoning, Max Effort)1495.03

Interactive version: theaggregate.ai/benchmark?slug=aa-gdpval · How the rankings work · Data refreshed daily, snapshot 2026-07-22.