HAL GAIA Level 2 — leaderboard

Metric: Accuracy (%). Source: hal.cs.princeton.edu. 32 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.5 (High)74.42
2Claude Sonnet 4.572.68
3Claude Opus 4.1 (High)70.93
4Claude Opus 4.1 (20250805)66.28
5Claude 3.7 Sonnet (High)63.95
6GPT-5 (Medium)62.79
7Claude Opus 4 (20250514)56.98
8GPT-4.1 (2025-04-14)55.81
9Claude 3.7 Sonnet (20250219)55.81
10O4 Mini (High)53.49
11Claude Haiku 4.5 (20251001)51.16
12O4 Mini (Low)51.16
13Gemini 2.0 Flash (001)32.56
14DeepSeek V3 (0324)31.97
15O3 (Medium)31.4

Interactive version: theaggregate.ai/benchmark?slug=hal-gaia-level-2 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.