Qwen 3 32B: benchmark results

Alibaba's open Qwen 3 32B dense model with hybrid thinking (April 2025). Provider: Alibaba. Released 2025-04-28. Access: Open.

Unified ELO 1552 ± 1, rank #425 of 1392 rated models, from 478 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open-R1 Eval Leaderboard73.74Average Accuracy (%)100
When the Manual Lies98Attack Success Rate (ASR) (self-reported)100
ChineseSafe Benchmark75.26Accuracy (%)96.3
LLMZSZL Leaderboard66.84Score95.9
MERA - ruOpenBookQA96Accuracy (%)95.2
MERA - ruTiE90.91Accuracy (%)94.3
MERA - LCS56.8Accuracy (%)93.8
Turkish MMLU76Accuracy (%)93.8
MERA - ruHateSpeech90.19Accuracy (%)93
Active Evidence-Seeking and Diagnostic Reasoni48.3Task 2: Active Seeking Exact Accuracy (self-reported)92.9
StakeBench17.6Agg (self-reported)92.9
Open PL LLM - Generative68.1Average Generative Score (%)92.7

Interactive version: theaggregate.ai/model?slug=qwen-3-32b · How It Works · Data refreshed daily, snapshot 2026-09-05.