HAL Reliability - Robustness: leaderboard

Metric: Robustness index (0-1, higher is better). Source: hal.cs.princeton.edu. 15 models tracked.

Top models

#ModelScore
1O10.99
2Gemini 3.5 Flash0.97
3GPT-5.50.96
4Claude Sonnet 40.95
5GPT-4o Mini0.95
6Claude Opus 4.70.95
7Claude Opus 4.50.94
8Gemini 3.1 Pro (Preview)0.94
9Claude 3.5 Haiku0.93
10GPT-5.2 (Medium)0.93
11Claude 3 Haiku0.92
12Gemini 2.5 Pro0.92
13GPT-5.20.85
14Gemini 2.5 Flash0.85
15GPT-4 Turbo0.84

Interactive version: theaggregate.ai/benchmark?slug=hal-reliability-robustness · How It Works · Data refreshed daily, snapshot 2026-09-19.