Qwen 2.5 Coder 32B — benchmark results

Alibaba Qwen 2.5 Coder 32B coding model row. Provider: Alibaba. Released 2024-11-12. Access: Open.

Unified ELO 1488 ± 35, rank #849 of 1776 rated models, from 21 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MMLU-Pro47.81Score92.9
GSM8K91.1Accuracy (%)92.6
Open LLM Leaderboard - BBH48.51Score88.8
Open LLM Leaderboard - GPQA12.86Score86.7
Open LLM Leaderboard - MuSR15.87Score84.2
Open LLM Leaderboard - MATH Level 530.89Score82.4
FormalRewardBench37.6Pairwise Accuracy (self-reported)80
MMLU79.1Accuracy (%)78.5
GeoCode Leaderboard66.77AutoGEEval++ Pass@1 (self-reported)77.8
HellaSwag83Accuracy (%)77.6
WinoGrande80.8Accuracy (%)77.5
BigCode Models Leaderboard57.1HumanEval Python Pass@1 (%)72.9

Interactive version: theaggregate.ai/model?slug=qwen-2-5-coder-32b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.