QwQ-32B — benchmark results
Alibaba's RL-trained 32B reasoning model, matching the far larger DeepSeek-R1 on math and coding under Apache 2.0 (March 2025). Provider: Alibaba. Released 2025-03-05. Access: Open.
Unified ELO 1501 ± 10, rank #793 of 1776 rated models, from 409 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| VMLU | 76.13 | Average (%) | 100 |
| VMLU - Other | 70.62 | Accuracy (%) | 100 |
| VMLU - STEM | 81.11 | Accuracy (%) | 100 |
| VMLU - Social Science | 78.49 | Accuracy (%) | 100 |
| Open Japanese LLM - Wiki NER SET F1 | 17.7 | Score (%) | 99 |
| ProLLM - OpenBook Q&A | 91.9 | Score (%) | 97.8 |
| EuroEval English NLU - SST-5 | 70.14 | Sentiment classification Score (%) | 97.6 |
| EuroEval Dutch NLU - CoNLL NL | 75.09 | Named entity recognition Score (%) | 96.5 |
| EuroEval Dutch | 73.98 | Average Score (%) | 96.2 |
| VMLU - Humanities | 71.78 | Accuracy (%) | 95.8 |
| EuroEval Italian | 66.34 | Average Score (%) | 95.1 |
| EuroEval Spanish | 61.55 | Average Score (%) | 94.2 |
Interactive version: theaggregate.ai/model?slug=qwq-32b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.