Qwen 2.5 Coder 7B: benchmark results
Provider: Alibaba. Released 2024-09-19. Access: Open.
Unified ELO 1454 ± 1, rank #926 of 1392 rated models, from 25 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| DomainCodeBench | 89.77 | Composite Score (%) | 100 |
| GSM8K | 83.9 | Accuracy (%) | 81.7 |
| DuckDB-NSQL | 58.7 | Execution Accuracy (%) | 69.8 |
| Open LLM Leaderboard - MATH Level 5 | 19.18 | Score | 69.5 |
| Open LLM Leaderboard - MMLU-Pro | 29.77 | Score | 58.8 |
| ARC Challenge (AI2) | 60.9 | Accuracy (%) | 56.6 |
| HellaSwag | 76.8 | Accuracy (%) | 48.7 |
| GSMA Open-Telco - TeleTables | 29.4 | Score (%) | 48.3 |
| MMLU | 68 | Accuracy (%) | 46.7 |
| Open LLM Leaderboard - BBH | 28.44 | Score | 46.5 |
| WinoGrande | 72.9 | Accuracy (%) | 45.6 |
| GeoCode Leaderboard | 50.51 | AutoGEEval++ Pass@1 (self-reported) | 40.9 |
Interactive version: theaggregate.ai/model?slug=qwen-2-5-coder-7b · How It Works · Data refreshed daily, snapshot 2026-09-05.