QwQ 32B-Preview: benchmark results
Alibaba's experimental 32B reasoning preview that pioneered Qwen's long chain-of-thought approach ahead of the full QwQ-32B release (November 2024). Provider: Alibaba. Released 2024-11-27. Access: Open.
Unified ELO 1465 ± 1, rank #871 of 1392 rated models, from 155 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - MMLU-Pro | 51.98 | Score | 99 |
| Open PL LLM - Multiple Choice | 65.26 | Average Multiple-Choice Score (%) | 99 |
| Open Japanese LLM - CG | 66.06 | Score (%) | 98.3 |
| Open PL LLM Leaderboard | 67.01 | Average Score (%) | 98.3 |
| Open Japanese LLM - RC | 92.54 | Score (%) | 96.3 |
| Open LLM Leaderboard - BBH | 53.39 | Score | 96.1 |
| Enkrypt AI - Insecure Code Risk | 3.11 | Risk Score | 95.6 |
| Open Japanese LLM Leaderboard | 67.15 | Average Score (%) | 94.7 |
| Open PL LLM - Generative | 68.35 | Average Generative Score (%) | 94.4 |
| Thai LLM NLU - xcopa_tha_seacrowd_qa | 93.2 | Accuracy (%) | 94.2 |
| CodeElo | 1261 | Elo Rating | 94.1 |
| Open Japanese LLM - Jnli Exact Match | 89.65 | Score (%) | 93.9 |
Interactive version: theaggregate.ai/model?slug=qwq-32b-preview · How It Works · Data refreshed daily, snapshot 2026-09-05.