GAIA2 — leaderboard

Meta's Agents Research Environments (ARE) benchmark scoring general assistants on execution, search, ambiguity, adaptability, and robustness to noise.

Metric: Pass@1 (%). Source: huggingface.co. Status: saturation imminent. 16 models tracked.

Top models

#ModelScore
1GPT-5 (High)42.1
2Claude Sonnet 4 (Thinking)37.8
3Claude Sonnet 434.8
4GPT-5 (Low)34.6
5Gemini 2.5 Pro25.8
6DeepSeek V3.1 Terminus23.1
7DeepSeek V3.121.9
8Kimi K220.1
9GPT-5 (Minimal)18.2
10Grok 415.7
11Qwen 3 235B A22B (Thinking)15.7
12GPT-OSS-120B (High)13.7
13Qwen 3 235B A22B11.6
14GPT-4o7.4
15Llama 4 Maverick7.4

Interactive version: theaggregate.ai/benchmark?slug=gaia2 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.