Arena-Hard v2 — leaderboard

Challenging real-world prompt benchmark from LMArena, using automated pairwise judging to separate frontier chat-model quality on open-ended tasks.

Metric: Win Rate (%). Source: github.com. Status: saturation imminent. 28 models tracked.

Top models

#ModelScore
1O3 (2025-04-16)85.9
2O4 Mini (2025-04-16) (High)79.1
3O4 Mini (2025-04-16)74.6
4Gemini 2.5 Flash68.6
5O3 Mini (2025-01-31) (High)66.1
6O1 (2024-12-17) (High)61
7Qwen 3 235B A22B58.4
8DeepSeek R158
9O1 (2024-12-17)55.9
10GPT-4.150
11O3 Mini (2025-01-31)50
12GPT-4.5 (Preview)50
13GPT-4.1 Mini46.9
14Qwen 3 32B44.5
15QwQ-32B43.5

Interactive version: theaggregate.ai/benchmark?slug=arena-hard-v2 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.