DialDefer - Judgment Accuracy (Conversational Framing): leaderboard

Metric: Accuracy (%; conversational framing, 'Is Speaker 2 correct?': judging whether a given answer is correct, mean of true- and false-answer accuracy per domain, averaged over ten domains, 3,244 items). Source: arxiv.org. Saturation forecast: Around December 2026. 5 models tracked.

Top models

#ModelScore
1GPT-5 Mini75.4
2GPT-4o (2024-11-20)67.6
3GPT-4o Mini62.6
4Gemma 3 12B (IT)61.4
5Qwen 2.5 7B Instruct59.2

Interactive version: theaggregate.ai/benchmark?slug=dialdefer-judgment-accuracy-conversational-framing · How It Works · Data refreshed daily, snapshot 2026-09-25.