GSM8K: leaderboard

Grade School Math 8K: 8,500 grade-school math word problems requiring multi-step arithmetic reasoning. A foundational math benchmark, now largely saturated by frontier models.

Metric: Accuracy (%). Source: epoch.ai. Status: saturated. 93 models tracked.

Top models

#ModelScore
1Median Human95
2Qwen 2.5 Coder 14B Instruct94.2
3Qwen 2.5 Coder 32B Instruct93
4GPT-4 (0314)92
5GPT-4o Mini (2024-07-18)91.3
6Qwen 2.5 Coder 32B91.1
7GPT-4 (0613)89.99
8Phi-3.5-MoE-instruct88.7
9Qwen 2.5 Coder 14B88.7
10Qwen 2.5 Coder 7B Instruct86.7
11Claude Instant 1.286.7
12Phi-3.5-mini-instruct86.2
13Gemma 2 9B84.9
14Mistral-Nemo-Base-240784.2
15Qwen 2.5 Coder 7B83.9

Interactive version: theaggregate.ai/benchmark?slug=gsm8k · How It Works · Data refreshed daily, snapshot 2026-09-05.