Confidence Decision Faithfulness - GPQA Diamond - Normalized Regret: leaderboard

Metric: Penalty-normalized Regret (0-1). Source: arxiv.org. 10 models tracked.

Top models

#ModelScore
1Gemini 2.5 Flash0.01
2Gemini 3 Flash0.01
3Qwen 3 Next 80B A3B (Thinking)0.02
4GPT-4.1 Mini0.02
5DeepSeek V3.2 (Non-reasoning)0.02
6Llama 4 Maverick0.03
7GPT-5 Mini0.04
8DeepSeek V3.2 (Thinking)0.05
9Gemma 3n E4B (IT)0.06
10GPT-5 Nano0.11

Interactive version: theaggregate.ai/benchmark?slug=confidence-decision-faithfulness-gpqa-diamond-normalized-regret · How It Works · Data refreshed daily, snapshot 2026-09-19.