FactArena - Evidence Retrieval: leaderboard

Metric: Elo rating from pairwise judged comparisons. Source: arxiv.org. Saturation forecast: Around September 2026. 16 models tracked.

Top models

#ModelScore
1O3 (2025-04-16)1351.95
2DeepSeek R11129.69
3O4 Mini (2025-04-16)1129.67
4Gemini 2.5 Pro (Preview 06-05)1066.15
5GPT-4.5 (Preview)1041.89
6GPT-4.11033.21
7Grok 31007.77
8Grok 3 Mini Beta960.1
9Gemini 2.5 Flash955.35
10Claude Opus 4 (20250514)949.44
11DeepSeek V3924.27
12Llama 4 Maverick Instruct916.68
13Claude Sonnet 4 (20250514)908.29
14Qwen 3 235B A22B892.18
15GPT-4o888.55

Interactive version: theaggregate.ai/benchmark?slug=factarena-evidence-retrieval · How It Works · Data refreshed daily, snapshot 2026-09-25.