HAL GAIA Level 3 — leaderboard

Metric: Accuracy (%). Source: hal.cs.princeton.edu. 32 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.565.39
2Claude Haiku 4.5 (20251001)61.54
3Claude 3.7 Sonnet (High)57.69
4O4 Mini (Low)53.85
5Claude Opus 4.1 (High)53.85
6Claude 3.7 Sonnet (20250219)46.15
7GPT-5 (Medium)46.15
8O4 Mini (High)46.15
9Claude Sonnet 4.5 (High)46.15
10Claude Opus 4 (20250514)42.31
11Claude Opus 4.1 (20250805)42.31
12GPT-4.1 (2025-04-14)34.62
13O3 (Medium)23.08
14DeepSeek R115.38
15Gemini 2.0 Flash (001)11.54

Interactive version: theaggregate.ai/benchmark?slug=hal-gaia-level-3 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.