Open-R1 Eval Leaderboard — leaderboard
Open-R1 released-model reasoning leaderboard aggregating LightEval results across math, GPQA, AIME, MATH-500, and related reasoning tasks.
Metric: Average Accuracy (%). Source: huggingface.co. Status: saturation imminent. 37 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Qwen 3 32B | 73.74 |
| 2 | Qwen 3 30B A3B | 72.94 |
| 3 | Qwen 3 14B | 72.67 |
| 4 | QwQ-32B | 70.58 |
| 5 | Qwen 3 8B | 69.79 |
| 6 | DeepSeek R1 Distill Qwen 32B | 65.96 |
| 7 | DeepSeek R1 Distill Llama 70B | 65.75 |
| 8 | Qwen 3 4B | 65.61 |
| 9 | DeepSeek R1 Distill Qwen 14B | 63.12 |
| 10 | DeepSeek-R1-Distill-Qwen-7B | 51.57 |
| 11 | QwQ 32B-Preview | 51.01 |
| 12 | Qwen 3 1.7B | 48.95 |
| 13 | DeepSeek R1 Distill Llama 8B | 47.77 |
| 14 | OpenThinker-7B | 37.37 |
| 15 | DeepSeek R1 Distill Qwen 1.5B | 34.46 |
Interactive version: theaggregate.ai/benchmark?slug=open-r1-eval-leaderboard · How the rankings work · Data refreshed daily, snapshot 2026-07-22.