Qwen 2.5 Coder 7B — benchmark results
Provider: Alibaba. Released 2024-09-19. Access: Open.
Unified ELO 1387 ± 30, rank #1278 of 1776 rated models, from 26 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| DomainCodeBench | 89.77 | Composite Score (%) | 100 |
| GSM8K | 83.9 | Accuracy (%) | 80.9 |
| DuckDB-NSQL | 58.7 | Execution Accuracy (%) | 69.8 |
| Open LLM Leaderboard - MATH Level 5 | 19.18 | Score | 69.5 |
| Open LLM Leaderboard - MMLU-Pro | 29.77 | Score | 58.8 |
| ARC Challenge (AI2) | 60.9 | Accuracy (%) | 55.1 |
| GSMA Open-Telco - TeleTables | 29.4 | Score (%) | 49.4 |
| HellaSwag | 76.8 | Accuracy (%) | 48.7 |
| MMLU | 68 | Accuracy (%) | 46.7 |
| Open LLM Leaderboard - BBH | 28.44 | Score | 46.5 |
| WinoGrande | 72.9 | Accuracy (%) | 45.6 |
| GSMA Open-Telco - TeleLogs | 17.82 | Score (%) | 40.7 |
Interactive version: theaggregate.ai/model?slug=qwen-2-5-coder-7b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.