Qwen 2.5 Coder 14B Instruct — benchmark results

Alibaba's Apache-2.0 14B code model from the November 2024 Qwen2.5-Coder expansion to six sizes, trained on 5.5T code-heavy tokens with 128K context. Provider: Alibaba. Released 2024-11-12. Access: Open.

Unified ELO 1459 ± 25, rank #959 of 1776 rated models, from 64 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
GSM8K94.2Accuracy (%)96.8
Open Japanese LLM - Wiki PAS SET F111.46Score (%)94.7
Open Korean LLM Leaderboard596.59Average Score (%)93.7
BigCodeBench48.2Pass@1 (%)91.3
Open LLM Leaderboard - BBH44.22Score84.4
Open LLM Leaderboard - MATH Level 532.48Score83.4
Open LLM Leaderboard - IFEval69.08Score82
Open Japanese LLM - Wiki Coreference SET F15.92Score (%)75.8
Open LLM Leaderboard - MMLU-Pro32.66Score72.1
FullStackBench en55.28Score (self-reported)63
CodeElo424Elo Rating61.8
Open LLM Leaderboard - GPQA7.27Score61.2

Interactive version: theaggregate.ai/model?slug=qwen-2-5-coder-14b-instruct · How the rankings work · Data refreshed daily, snapshot 2026-07-22.