Qwen 2.5 32B Instruct — benchmark results

Alibaba Qwen 2.5 32B instruction-tuned checkpoint. Provider: Alibaba. Released 2024-09-19. Access: Open.

Unified ELO 1559 ± 11, rank #594 of 1776 rated models, from 363 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
PlantMarkerBench75.4Valid F1 (self-reported)100
SeaEval - Fundamental NLP Tasks - MNLI (Zero-Shot)87.15Accuracy (%)100
SeaEval - Fundamental NLP Tasks - RTE (Zero-Shot)90.97Accuracy (%)100
Open LLM Leaderboard - MATH Level 562.54Score99.9
Open LLM Leaderboard - IFEval83.46Score99.4
Open LLM Leaderboard - MMLU-Pro51.85Score98.9
Open LLM Leaderboard - BBH56.49Score98.5
OpenEval - BBQ95.3Exact Match (%)98.3
Open Arabic LLM - Arabic MMLU HT Moral Scenarios58.1Accuracy (%)98.1
MT-Bench PL - Reasoning9.1Judge Score (0-10)98
SeaEval - Fundamental NLP Tasks - QQP (Zero-Shot)83.15Accuracy (%)97.8
MT-Bench PL - Extraction9.9Judge Score (0-10)96.9

Interactive version: theaggregate.ai/model?slug=qwen-2-5-32b-instruct · How the rankings work · Data refreshed daily, snapshot 2026-07-22.