Qwen 2.5 32B — benchmark results

Alibaba's 32B dense base model from the Qwen2.5 series, pretrained on up to 18T tokens under Apache 2.0 (September 2024). Provider: Alibaba. Released 2024-09-19. Access: Open.

Unified ELO 1506 ± 12, rank #777 of 1776 rated models, from 241 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - GPQA21.59Score99.6
Open LLM Leaderboard - MMLU-Pro53.39Score99.4
Open PL LLM - Multiple Choice64.7Average Multiple-Choice Score (%)98.3
Open LLM Leaderboard - MuSR22.7Score98
Open PL LLM Leaderboard66.73Average Score (%)97.9
Open Japanese LLM - Jsts Pearson90.84Score (%)97.1
Open LLM Leaderboard - BBH53.95Score96.4
Open Japanese LLM - RC92.54Score (%)96.3
Open Japanese LLM - Jsts Spearman88.1Score (%)95.2
Open Arabic LLM - Alghafa Multiple Choice Rating Sentiment NO Neutral Task82.54Accuracy (%)94.4
Open PL LLM - Generative68.28Average Generative Score (%)93.4
Open Japanese LLM - SUM12.05Score (%)91.5

Interactive version: theaggregate.ai/model?slug=qwen-2-5-32b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.