Qwen 2.5 Coder 32B Instruct: benchmark results

Alibaba's Apache-2.0 32B code specialist that matched GPT-4o on coding benchmarks - the open-source SOTA coder at release (November 2024). Provider: Alibaba. Released 2024-11-12. Access: Open.

Unified ELO 1512 ± 1, rank #638 of 1392 rated models, from 131 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Japanese LLM - CG68.47Score (%)99.8
EvalPlus (HumanEval+ & MBPP+)82.1Pass@1 avg (%)97.6
GSM8K93Accuracy (%)96.8
BigCode Models Leaderboard83.2HumanEval Python Pass@1 (%)96.6
Open LLM Leaderboard - MATH Level 549.55Score96.6
MERA Code - RealCodeJava38.59pass@1 (%)95.4
BigCodeBench49Pass@1 (%)95.2
Open LLM Leaderboard - BBH52.27Score95
EvalPlus82.1EvalPlus Avg. (self-reported)91.7
MBPP+77MBPP+ pass@1 (self-reported)91.7
Open Japanese LLM - Janli Exact Match87.08Score (%)90.5
HumanEval+87.2HumanEval+ pass@1 (self-reported)89.1

Interactive version: theaggregate.ai/model?slug=qwen-2-5-coder-32b-instruct · How It Works · Data refreshed daily, snapshot 2026-09-05.