FactArena - Verdict Accuracy: leaderboard

Metric: Accuracy (%). Source: arxiv.org. Saturation forecast: Around 2030. 16 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro (Preview 06-05)66.52
2O3 (2025-04-16)65.02
3GPT-4.164.32
4O4 Mini (2025-04-16)64.14
5Llama 4 Maverick Instruct60.91
6GPT-4.5 (Preview)59.41
7DeepSeek V355.77
8Gemini 2.5 Flash55.51
9DeepSeek R155.14
10Grok 355.14
11Qwen 3 235B A22B55.13
12Grok 3 Mini Beta52.75
13Qwen 3 32B51.76
14GPT-4o50.95
15Claude Opus 4 (20250514)44.34

Interactive version: theaggregate.ai/benchmark?slug=factarena-verdict-accuracy · How It Works · Data refreshed daily, snapshot 2026-09-25.