GSM8K: leaderboard
Grade School Math 8K: 8,500 grade-school math word problems requiring multi-step arithmetic reasoning. A foundational math benchmark, now largely saturated by frontier models.
Metric: Accuracy (%). Source: epoch.ai. Status: saturated. 93 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Median Human | 95 |
| 2 | Qwen 2.5 Coder 14B Instruct | 94.2 |
| 3 | Qwen 2.5 Coder 32B Instruct | 93 |
| 4 | GPT-4 (0314) | 92 |
| 5 | GPT-4o Mini (2024-07-18) | 91.3 |
| 6 | Qwen 2.5 Coder 32B | 91.1 |
| 7 | GPT-4 (0613) | 89.99 |
| 8 | Phi-3.5-MoE-instruct | 88.7 |
| 9 | Qwen 2.5 Coder 14B | 88.7 |
| 10 | Qwen 2.5 Coder 7B Instruct | 86.7 |
| 11 | Claude Instant 1.2 | 86.7 |
| 12 | Phi-3.5-mini-instruct | 86.2 |
| 13 | Gemma 2 9B | 84.9 |
| 14 | Mistral-Nemo-Base-2407 | 84.2 |
| 15 | Qwen 2.5 Coder 7B | 83.9 |
Interactive version: theaggregate.ai/benchmark?slug=gsm8k · How It Works · Data refreshed daily, snapshot 2026-09-05.