GAIA2 - Adaptability — leaderboard

Metric: Score (%). Source: huggingface.co. 16 models tracked.

Top models

#ModelScore
1Claude Sonnet 4 (Thinking)42.1
2GPT-5 (High)40.4
3Claude Sonnet 438.1
4DeepSeek V3.1 Terminus32.5
5DeepSeek V3.131.2
6GPT-5 (Low)30.2
7Kimi K224
8GPT-5 (Minimal)19.2
9Gemini 2.5 Pro17.5
10Qwen 3 235B A22B (Thinking)16.2
11GPT-OSS-120B (High)10.6
12Qwen 3 235B A22B8.1
13GPT-4o6.2
14Llama 4 Maverick5
15Grok 44.4

Interactive version: theaggregate.ai/benchmark?slug=gaia2-adaptability · How the rankings work · Data refreshed daily, snapshot 2026-07-22.