Qwen 2.5 Coder 32B: benchmark results

Alibaba's open Qwen 2.5 Coder 32B, the flagship code model of the Qwen 2.5 Coder series (November 2024). Provider: Alibaba. Released 2024-11-12. Access: Open.

Unified ELO 1530 ± 1, rank #546 of 1392 rated models, from 20 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
GSM8K91.1Accuracy (%)93.5
Open LLM Leaderboard - MMLU-Pro47.81Score92.9
Open LLM Leaderboard - BBH48.51Score88.7
Open LLM Leaderboard - GPQA12.86Score86.7
Open LLM Leaderboard - MuSR15.87Score84.2
Open LLM Leaderboard - MATH Level 530.89Score82.4
FormalRewardBench37.6Pairwise Accuracy (self-reported)80
MMLU79.1Accuracy (%)78.5
HellaSwag83Accuracy (%)77.6
WinoGrande80.8Accuracy (%)77.5
BigCode Models Leaderboard57.1HumanEval Python Pass@1 (%)72.9
GeoCode Leaderboard66.77AutoGEEval++ Pass@1 (self-reported)72.7

Interactive version: theaggregate.ai/model?slug=qwen-2-5-coder-32b · How It Works · Data refreshed daily, snapshot 2026-09-05.