GAIA2 - Execution — leaderboard

Metric: Score (%). Source: huggingface.co. 16 models tracked.

Top models

#ModelScore
1GPT-5 (High)69.2
2Claude Sonnet 4 (Thinking)62.1
3Claude Sonnet 457.9
4GPT-5 (Low)52.7
5DeepSeek V3.1 Terminus43.1
6DeepSeek V3.139.8
7Gemini 2.5 Pro39.2
8Kimi K234.2
9GPT-5 (Minimal)31.9
10Qwen 3 235B A22B (Thinking)28.1
11Qwen 3 235B A22B22.7
12GPT-OSS-120B (High)17.9
13Llama 4 Maverick13.8
14Grok 48.8
15GPT-4o8.3

Interactive version: theaggregate.ai/benchmark?slug=gaia2-execution · How the rankings work · Data refreshed daily, snapshot 2026-07-22.