ConfidenceBench - Accuracy: leaderboard

Metric: Accuracy (%). Source: arxiv.org. 15 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)82.7
2GPT-576.6
3Claude Opus 4.676
4GPT-5 (High)75.8
5GPT-5 (Low)74.9
6Claude Opus 4.574.5
7GPT-5 Mini72.1
8Claude Sonnet 4.570.8
9GPT-5 Nano70.5
10Gemini 2.5 Pro69.4
11Claude Sonnet 4.669
12Claude Opus 4.167.3
13Gemini 2.5 Flash60.6
14Claude Sonnet 457.8
15Gemini 3.1 Flash Lite55.3

Interactive version: theaggregate.ai/benchmark?slug=confidencebench-accuracy · How It Works · Data refreshed daily, snapshot 2026-09-21.