GAIA2 - Ambiguity — leaderboard

Metric: Score (%). Source: huggingface.co. 16 models tracked.

Top models

#ModelScore
1GPT-5 (High)51.9
2GPT-5 (Low)39.6
3Claude Sonnet 4 (Thinking)27.3
4Claude Sonnet 424.2
5GPT-5 (Minimal)20.6
6Gemini 2.5 Pro18.1
7DeepSeek V3.1 Terminus13.1
8DeepSeek V3.111.2
9Qwen 3 235B A22B (Thinking)10
10Grok 49.4
11Kimi K28.3
12GPT-OSS-120B (High)8.3
13Qwen 3 235B A22B6.5
14GPT-4o4.4
15Llama 4 Maverick2.1

Interactive version: theaggregate.ai/benchmark?slug=gaia2-ambiguity · How the rankings work · Data refreshed daily, snapshot 2026-07-22.