Qwen 2 72B — benchmark results
Alibaba's open 72B flagship of the 2024 Qwen2 series, with a 128K context via YaRN. Provider: Alibaba. Released 2024-06-10. Access: Open.
Unified ELO 1576 ± 10, rank #543 of 1776 rated models, from 157 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| OpenEvals - GSM8K | 89.5 | Accuracy (%) | 100 |
| RABBITS B4B | 83.72 | Accuracy (%) | 100 |
| Open Chinese LLM - C-Eval Semantic | 93.47 | Accuracy (%) | 99.7 |
| Open Chinese LLM - CMMLU | 78.66 | Accuracy (%) | 99.7 |
| Open Chinese LLM - GSM8K | 75.36 | Accuracy (%) | 99.7 |
| Open LLM Leaderboard - MMLU-Pro | 52.56 | Score | 99.2 |
| Open Arabic LLM - Arabic MMLU HT Global Facts | 54 | Accuracy (%) | 98.8 |
| Open LLM Leaderboard - GPQA | 19.24 | Score | 98.4 |
| Open Chinese LLM Leaderboard | 72.66 | Average Score (%) | 97.9 |
| Open Arabic LLM - Arabic MMLU HT US Foreign Policy | 87 | Accuracy (%) | 97.5 |
| Open Chinese LLM - HellaSwag | 73.26 | Accuracy (%) | 97.3 |
| Open Arabic LLM - Alghafa Multiple Choice Facts Truefalse Balanced Task | 96 | Accuracy (%) | 97.2 |
Interactive version: theaggregate.ai/model?slug=qwen-2-72b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.