ConfidenceBench - Calibration Error: leaderboard

Metric: Expected Calibration Error (0-1). Source: arxiv.org. 15 models tracked.

Top models

#ModelScore
1GPT-50.07
2Claude Opus 4.60.07
3GPT-5 (High)0.08
4GPT-5 (Low)0.08
5GPT-5 Nano0.08
6Gemini 3.1 Pro (Preview)0.09
7GPT-5 Mini0.09
8Claude Sonnet 4.60.1
9Claude Sonnet 4.50.11
10Claude Opus 4.10.12
11Claude Opus 4.50.14
12Claude Sonnet 40.17
13Gemini 2.5 Flash0.19
14Gemini 2.5 Pro0.2
15Gemini 3.1 Flash Lite0.34

Interactive version: theaggregate.ai/benchmark?slug=confidencebench-calibration-error · How It Works · Data refreshed daily, snapshot 2026-09-21.