Qwen 2.5 32B Instruct: benchmark results

Alibaba Qwen 2.5 32B instruction-tuned checkpoint. Provider: Alibaba. Released 2024-09-19. Access: Open.

Unified ELO 1542 ± 1, rank #471 of 1392 rated models, from 418 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
SeaEval - Fundamental NLP Tasks - MNLI (Zero-Shot)87.15Accuracy (%)100
SeaEval - Fundamental NLP Tasks - RTE (Zero-Shot)90.97Accuracy (%)100
Open LLM Leaderboard - MATH Level 562.54Score99.9
Open LLM Leaderboard - IFEval83.46Score99.4
Open LLM Leaderboard - MMLU-Pro51.85Score98.9
MERA - BPS100Accuracy (%)98.6
Open LLM Leaderboard - BBH56.49Score98.5
Open Arabic LLM - Arabic MMLU HT Moral Scenarios58.1Accuracy (%)98.1
MT-Bench PL - Reasoning9.1Judge Score (0-10)98
SeaEval - Fundamental NLP Tasks - QQP (Zero-Shot)83.15Accuracy (%)97.8
Thai LLM - Coding8.14Rating (0-10)97.2
MT-Bench PL - Extraction9.9Judge Score (0-10)96.9

Interactive version: theaggregate.ai/model?slug=qwen-2-5-32b-instruct · How It Works · Data refreshed daily, snapshot 2026-09-05.