Qwen 2.5 Coder 7B: benchmark results

Provider: Alibaba. Released 2024-09-19. Access: Open.

Unified ELO 1454 ± 1, rank #926 of 1392 rated models, from 25 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
DomainCodeBench89.77Composite Score (%)100
GSM8K83.9Accuracy (%)81.7
DuckDB-NSQL58.7Execution Accuracy (%)69.8
Open LLM Leaderboard - MATH Level 519.18Score69.5
Open LLM Leaderboard - MMLU-Pro29.77Score58.8
ARC Challenge (AI2)60.9Accuracy (%)56.6
HellaSwag76.8Accuracy (%)48.7
GSMA Open-Telco - TeleTables29.4Score (%)48.3
MMLU68Accuracy (%)46.7
Open LLM Leaderboard - BBH28.44Score46.5
WinoGrande72.9Accuracy (%)45.6
GeoCode Leaderboard50.51AutoGEEval++ Pass@1 (self-reported)40.9

Interactive version: theaggregate.ai/model?slug=qwen-2-5-coder-7b · How It Works · Data refreshed daily, snapshot 2026-09-05.