HAL GAIA — leaderboard

Metric: Accuracy (%). Source: hal.cs.princeton.edu. 32 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.574.55
2Claude Sonnet 4.5 (High)70.91
3Claude Opus 4.1 (High)68.48
4Claude Opus 4.1 (20250805)64.24
5Claude 3.7 Sonnet (High)64.24
6GPT-5 (Medium)62.8
7O4 Mini (Low)58.18
8Claude Opus 4 (20250514)57.58
9Claude Haiku 4.5 (20251001)56.36
10Claude 3.7 Sonnet (20250219)56.36
11O4 Mini (High)55.76
12GPT-4.1 (2025-04-14)50.3
13Gemini 2.0 Flash (001)32.73
14O3 (Medium)32.73
15DeepSeek R130.3

Interactive version: theaggregate.ai/benchmark?slug=hal-gaia · How the rankings work · Data refreshed daily, snapshot 2026-07-22.