HAL Reliability - Predictability: leaderboard

Metric: Predictability index (0-1, higher is better). Source: hal.cs.princeton.edu. 15 models tracked.

Top models

#ModelScore
1Claude Opus 4.50.84
2GPT-5.50.82
3Gemini 3.5 Flash0.81
4Gemini 3.1 Pro (Preview)0.8
5Claude Opus 4.70.8
6Claude Sonnet 40.79
7Gemini 2.5 Pro0.74
8GPT-5.20.74
9O10.71
10GPT-5.2 (Medium)0.67
11Gemini 2.5 Flash0.62
12GPT-4 Turbo0.61
13Claude 3.5 Haiku0.59
14GPT-4o Mini0.46
15Claude 3 Haiku0.43

Interactive version: theaggregate.ai/benchmark?slug=hal-reliability-predictability · How It Works · Data refreshed daily, snapshot 2026-09-19.