LLMConfBench: leaderboard

Metric: Conformer Ranking Accuracy (mean reliable-pair Kendall tau). Source: arxiv.org. 27 models tracked.

Top models

#ModelScore
1GPT-60.67
2Claude Opus 50.61
3Gemini 3.6 Flash0.43
4GPT-5.6 Sol0.4
5Kimi K30.38
6Claude Sonnet 50.37
7DeepSeek V4 Flash (0731)0.33
8Gemini 3 Flash (Preview)0.32
9Qwen 3.7 Max0.32
10Qwen 3.8 27B0.31
11GPT-50.3
12Gemma 4 31B0.27
13Kimi K2 (Thinking)0.27
14Qwen 3.5 27B0.19
15Qwen 3.5 Plus (2026-04-20)0.18

Interactive version: theaggregate.ai/benchmark?slug=llmconfbench · How It Works · Data refreshed daily, snapshot 2026-09-20.