QwQ 32B-Preview — benchmark results

Alibaba's experimental 32B reasoning preview that pioneered Qwen's long chain-of-thought approach ahead of the full QwQ-32B release (November 2024). Provider: Alibaba. Released 2024-11-27. Access: Open.

Unified ELO 1518 ± 23, rank #736 of 1776 rated models, from 115 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MMLU-Pro51.98Score99
Open PL LLM - Multiple Choice65.26Average Multiple-Choice Score (%)99
Open Japanese LLM - CG66.06Score (%)98.3
Open PL LLM Leaderboard67.01Average Score (%)98.3
Open Japanese LLM - RC92.54Score (%)96.3
Open LLM Leaderboard - BBH53.39Score96.1
Open Japanese LLM Leaderboard67.15Average Score (%)94.7
Open PL LLM - Generative68.35Average Generative Score (%)94.4
CodeElo1261Elo Rating94.1
Open Japanese LLM - Jnli Exact Match89.65Score (%)93.9
Open LLM Leaderboard - MATH Level 544.94Score93.3
Open Persian LLM - ARC Challenge87.24Accuracy (%)93.3

Interactive version: theaggregate.ai/model?slug=qwq-32b-preview · How the rankings work · Data refreshed daily, snapshot 2026-07-22.