ConfBench - Confidence AUROC: leaderboard

Metric: AUROC of the verbalized confidence for separating correct from incorrect extracted entities (0-1, 0.5 is chance; verbalized top-4 guesses with probabilities in one call, OCR text with Amazon Textract confidences plus the document image, over the entity fields of 1,346 degraded variants of 75 RealKIE-FCC-Verified invoices). Source: arxiv.org. Saturation forecast: Around December 2026. 7 models tracked.

Top models

#ModelScore
1Claude Opus 4.60.84
2Claude Sonnet 4.50.77
3Claude Haiku 4.50.74
4Qwen 3.6 27B0.72
5Kimi K2.50.67
6Qwen 3 VL 235B A22B0.62
7Gemma 3 12B0.58

Interactive version: theaggregate.ai/benchmark?slug=confbench-confidence-auroc · How It Works · Data refreshed daily, snapshot 2026-09-29.