HAL Reliability - Overall: leaderboard

Metric: Overall reliability (0-1, mean of consistency, predictability and robustness; higher is better). Source: hal.cs.princeton.edu. 15 models tracked.

Top models

#ModelScore
1Claude Opus 4.50.87
2Claude Opus 4.70.86
3Gemini 3.5 Flash0.85
4Gemini 3.1 Pro (Preview)0.84
5Claude Sonnet 40.84
6GPT-5.50.84
7O10.8
8Gemini 2.5 Pro0.8
9GPT-5.2 (Medium)0.77
10Claude 3.5 Haiku0.76
11GPT-5.20.76
12GPT-4 Turbo0.74
13Gemini 2.5 Flash0.73
14GPT-4o Mini0.72
15Claude 3 Haiku0.69

Interactive version: theaggregate.ai/benchmark?slug=hal-reliability-overall · How It Works · Data refreshed daily, snapshot 2026-09-19.