Open LLM Leaderboard v1 - MMLU: leaderboard
Metric: Accuracy (%) (5-shot). Source: huggingface.co. Saturation forecast: Estimated already saturated. 7252 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | 34B-beta | 85.6 |
| 2 | Qwen 2 72B | 83.79 |
| 3 | Llama 3 70B Instruct DPO V0.2 | 80.41 |
| 4 | Llama 3 70B Japanese Suzume Vector V0.1 | 80.28 |
| 5 | Qwen 1.5 110B | 80.2 |
| 6 | autotrain-llama3-70B-orpo-v1 | 80.11 |
| 7 | autotrain-llama3-70B-orpo-v2 | 80.07 |
| 8 | Llama 3 70B Instruct | 80.06 |
| 9 | Llama3-TenyxChat-70B | 80.04 |
| 10 | Tess-2.0-Llama-3-70B | 79.75 |
| 11 | Tess-2.0-Llama-3-70B-v0.2 | 79.51 |
| 12 | Llama 3 70B Orpo V0.1 | 79.39 |
| 13 | airoboros-70B-3.3 | 79.31 |
| 14 | Llama 3 70B | 79.23 |
| 15 | Llama 3 70B Fireplace | 78.97 |
Interactive version: theaggregate.ai/benchmark?slug=open-llm-leaderboard-v1-mmlu · How It Works · Data refreshed daily, snapshot 2026-09-23.