HAL CORE-Bench Hard — leaderboard

Princeton HAL leaderboard for CORE-Bench Hard: 270 computational reproducibility tasks from 90 scientific papers in CS, social science, and medicine. Tests ability to reproduce research results.

Metric: Accuracy (%). Source: hal.cs.princeton.edu. Status: saturation imminent. 49 models tracked.

Top models

#ModelScore
1Claude Opus 4.577.78
2Claude Sonnet 4.562.22
3Claude Opus 4.1 (20250805)51.11
4Claude Sonnet 4 (20250514)46.67
5Claude Sonnet 4.5 (High)44.44
6Claude Opus 4.142.22
7Claude Opus 4.5 (20251101)42.22
8Claude Opus 4.5 (High)42.22
9Claude Opus 4.1 (High)42.22
10Gemini 3 Pro (Preview) (High)40
11Claude 3.7 Sonnet (High)37.78
12Claude 3.7 Sonnet (20250219)35.56
13O4 Mini (High)35.56
14GPT-4.1 (2025-04-14)33.33
15GPT-5 (Medium)26.67

Interactive version: theaggregate.ai/benchmark?slug=hal-core-bench-hard · How the rankings work · Data refreshed daily, snapshot 2026-07-22.