Open LLM Leaderboard v1 - GSM8K: leaderboard
Metric: Accuracy (%) (5-shot). Source: huggingface.co. Saturation forecast: Estimated already saturated. 7252 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Llama 3 70B Instruct DPO V0.2 | 88.25 |
| 2 | Llama 3 70B Japanese Suzume Vector V0.1 | 87.41 |
| 3 | Llama3-TenyxChat-70B | 86.28 |
| 4 | autotrain-llama3-70B-orpo-v1 | 85.67 |
| 5 | Llama 3 70B Instruct | 85.44 |
| 6 | Qwen 2 72B | 85.29 |
| 7 | autotrain-llama3-70B-orpo-v2 | 84.23 |
| 8 | Llama 3 70B Fireplace | 83.62 |
| 9 | Mixtral 8x22B Instruct (v0.1) | 82.03 |
| 10 | Qwen 1.5 110B | 81.05 |
| 11 | Le_Triomphant-ECE-TW3 | 79.83 |
| 12 | Smaug-72B-v0.1 | 78.7 |
| 13 | Llama 3 70B | 76.88 |
| 14 | Llama 3 70B Orpo V0.1 | 76.8 |
| 15 | Rhea-72B-v0.5 | 76.12 |
Interactive version: theaggregate.ai/benchmark?slug=open-llm-leaderboard-v1-gsm8k · How It Works · Data refreshed daily, snapshot 2026-09-23.