HAL SciCode — leaderboard

Metric: Accuracy (%). Source: hal.cs.princeton.edu. 33 models tracked.

Top models

#ModelScore
1O3 (Medium)9.23
2O4 Mini (Low)9.23
3Claude Opus 4.1 (20250805)7.69
4Claude Opus 4.1 (High)6.92
5GPT-4.1 (2025-04-14)6.15
6GPT-5 (Medium)6.15
7O4 Mini (High)6.15
8Claude 3.7 Sonnet (High)4.62
9Claude Sonnet 4.53.08
10DeepSeek V3 (0324)3.08
11Claude 3.7 Sonnet (20250219)3.08
12Gemini 2.0 Flash (001)1.54
13Claude Sonnet 4.5 (High)1.54
14DeepSeek R10
15Claude Haiku 4.5 (20251001)0

Interactive version: theaggregate.ai/benchmark?slug=hal-scicode · How the rankings work · Data refreshed daily, snapshot 2026-07-22.