HAL GAIA Level 1 — leaderboard

Metric: Accuracy (%). Source: hal.cs.princeton.edu. 32 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.582.07
2Claude Sonnet 4.5 (High)77.36
3GPT-5 (Medium)73.58
4Claude Opus 4.1 (20250805)71.7
5O4 Mini (Low)71.7
6Claude Opus 4.1 (High)71.7
7O4 Mini (High)69.81
8Claude 3.7 Sonnet (High)67.92
9Claude Opus 4 (20250514)66.04
10Claude Haiku 4.5 (20251001)62.26
11Claude 3.7 Sonnet (20250219)62.26
12GPT-4.1 (2025-04-14)58.49
13DeepSeek R143.4
14Gemini 2.0 Flash (001)43.4
15O3 (Medium)39.62

Interactive version: theaggregate.ai/benchmark?slug=hal-gaia-level-1 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.