Confidence Decision Faithfulness - HLE - Normalized Regret: leaderboard

Metric: Penalty-normalized Regret (0-1). Source: arxiv.org. 10 models tracked.

Top models

#ModelScore
1Qwen 3 Next 80B A3B (Thinking)0.01
2GPT-4.1 Mini0.02
3Gemma 3n E4B (IT)0.03
4DeepSeek V3.2 (Non-reasoning)0.03
5Gemini 3 Flash0.04
6Llama 4 Maverick0.05
7Gemini 2.5 Flash0.06
8DeepSeek V3.2 (Thinking)0.06
9GPT-5 Mini0.07
10GPT-5 Nano0.15

Interactive version: theaggregate.ai/benchmark?slug=confidence-decision-faithfulness-hle-normalized-regret · How It Works · Data refreshed daily, snapshot 2026-09-19.