REFUTE — leaderboard

Metric: Truth Score (accuracy + calibration, higher is better). Source: huggingface.co. 15 models tracked.

Top models

#ModelScore
1Grok 4.2074.5
2Claude Opus 4.773.4
3Claude Opus 4.673.2
4Grok 3 Mini72.2
5Grok 4.371.5
6Gemini 3.1 Pro (Preview)71.2
7Kimi K2.671
8GPT-5.269.2
9Gemma 4 31B67.2
10GPT-5.464.3
11DeepSeek V4 Pro62.9
12Grok 4.1 Fast59.4
13GPT-OSS-120B57.5
14Llama 3.3 70B46.3

Interactive version: theaggregate.ai/benchmark?slug=refute · How It Works · Data refreshed daily, snapshot 2026-07-25.