Qwen 2.5 Coder 14B Instruct — benchmark results
Alibaba's Apache-2.0 14B code model from the November 2024 Qwen2.5-Coder expansion to six sizes, trained on 5.5T code-heavy tokens with 128K context. Provider: Alibaba. Released 2024-11-12. Access: Open.
Unified ELO 1459 ± 25, rank #959 of 1776 rated models, from 64 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| GSM8K | 94.2 | Accuracy (%) | 96.8 |
| Open Japanese LLM - Wiki PAS SET F1 | 11.46 | Score (%) | 94.7 |
| Open Korean LLM Leaderboard | 596.59 | Average Score (%) | 93.7 |
| BigCodeBench | 48.2 | Pass@1 (%) | 91.3 |
| Open LLM Leaderboard - BBH | 44.22 | Score | 84.4 |
| Open LLM Leaderboard - MATH Level 5 | 32.48 | Score | 83.4 |
| Open LLM Leaderboard - IFEval | 69.08 | Score | 82 |
| Open Japanese LLM - Wiki Coreference SET F1 | 5.92 | Score (%) | 75.8 |
| Open LLM Leaderboard - MMLU-Pro | 32.66 | Score | 72.1 |
| FullStackBench en | 55.28 | Score (self-reported) | 63 |
| CodeElo | 424 | Elo Rating | 61.8 |
| Open LLM Leaderboard - GPQA | 7.27 | Score | 61.2 |
Interactive version: theaggregate.ai/model?slug=qwen-2-5-coder-14b-instruct · How the rankings work · Data refreshed daily, snapshot 2026-07-22.