HAL ScienceAgentBench — leaderboard

Princeton HAL leaderboard for ScienceAgentBench: 102 data-driven scientific discovery tasks from 42 peer-reviewed papers across 4 disciplines.

Metric: Accuracy (%). Source: hal.cs.princeton.edu. Status: saturation imminent. 23 models tracked.

Top models

#ModelScore
1O3 (Medium)33.33
2GPT-5 (Medium)30.39
3Claude Sonnet 4.5 (High)30.39
4Claude 3.7 Sonnet (High)30.39
5Claude Sonnet 4.529.41
6O4 Mini (High)27.45
7Claude Opus 4.1 (20250805)27.45
8O4 Mini (Low)27.45
9Claude Opus 4.1 (High)26.47
10GPT-4.1 (2025-04-14)24.51
11DeepSeek R123.53
12Claude 3.7 Sonnet (20250219)22.55
13Claude Haiku 4.5 (20251001)18.63
14DeepSeek V3 (0324)15.69
15Gemini 2.0 Flash (001)12.75

Interactive version: theaggregate.ai/benchmark?slug=hal-scienceagentbench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.