HAL SciCode: leaderboard

Metric: Accuracy (%). Source: hal.cs.princeton.edu. 33 models tracked.

Top models

#ModelScore
1O4 Mini (Low)9.23
2O3 (Medium)9.23
3Claude Opus 4.1 (20250805)7.69
4Claude Opus 4.1 (High)6.92
5GPT-4.1 (2025-04-14)6.15
6GPT-5 (Medium)6.15
7O4 Mini (High)6.15
8Claude 3.7 Sonnet (High)4.62
9Claude Sonnet 4.53.08
10DeepSeek V3 (0324)3.08
11Claude 3.7 Sonnet (20250219)3.08
12Gemini 2.0 Flash (001)1.54
13Claude Sonnet 4.5 (High)1.54
14DeepSeek R10
15Claude Haiku 4.5 (20251001)0

Interactive version: theaggregate.ai/benchmark?slug=hal-scicode · How It Works · Data refreshed daily, snapshot 2026-09-05.