GSM8K — leaderboard

Grade School Math 8K: 8,500 grade-school math word problems requiring multi-step arithmetic reasoning. A foundational math benchmark, now largely saturated by frontier models.

Metric: Accuracy (%). Source: epoch.ai. Status: saturated. 93 models tracked.

Top models

#ModelScore
1Human Expert100
2Median Human95
3Qwen 2.5 Coder 14B Instruct94.2
4Qwen 2.5 Coder 32B Instruct93
5GPT-4 (0314)92
6GPT-4o Mini (2024-07-18)91.3
7Qwen 2.5 Coder 32B91.1
8GPT-4 (0613)89.99
9Phi-3.5-MoE-instruct88.7
10Qwen 2.5 Coder 14B88.7
11DeepSeek Coder V2 Lite Instruct87.6
12Qwen 2.5 Coder 7B Instruct86.7
13Claude Instant 1.286.7
14Phi-3.5-mini-instruct86.2
15Gemma 2 9B84.9

Interactive version: theaggregate.ai/benchmark?slug=gsm8k · How the rankings work · Data refreshed daily, snapshot 2026-07-22.