FactArena: leaderboard

Metric: Elo rating from pairwise judged comparisons. Source: arxiv.org. Saturation forecast: Around September 2026. 16 models tracked.

Top models

#ModelScore
1O3 (2025-04-16)1320.14
2DeepSeek R11127.77
3O4 Mini (2025-04-16)1108.47
4Gemini 2.5 Pro (Preview 06-05)1084.19
5GPT-4.5 (Preview)1047.15
6GPT-4.11041.71
7Grok 31022.09
8Grok 3 Mini Beta960.74
9Gemini 2.5 Flash955.6
10Claude Opus 4 (20250514)949.27
11DeepSeek V3934.38
12Llama 4 Maverick Instruct919.57
13Claude Sonnet 4 (20250514)905.28
14Qwen 3 235B A22B890.89
15GPT-4o890.75

Interactive version: theaggregate.ai/benchmark?slug=factarena · How It Works · Data refreshed daily, snapshot 2026-09-25.