Qwen 3 Next 80B A3B (Thinking): benchmark results
Alibaba Qwen 3 Next 80B A3B evaluated with thinking enabled. Provider: Alibaba. Released 2025-09-11. Access: Open.
Unified ELO 1562 ± 1, rank #591 of 1761 rated models, from 403 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| MERA Code - ruCodeEval | 76.22 | pass@1 (%) | 100 |
| MERA Code - ruHumanEval | 82.26 | pass@1 (%) | 100 |
| Medmarks - Med-HALT Reasoning NOTA | 78.86 | Score (%) | 100 |
| EuroEval Lithuanian Knowledge | 87.51 | Knowledge Average Score (%) | 99.5 |
| MERA - ruMultiAr | 100 | EM (%) | 98.6 |
| Medmarks - M-ARC | 75 | Score (%) | 98.6 |
| RewardBench 2 Safety | 94.89 | Accuracy (%) | 98 |
| EuroEval Polish Common Sense Reasoning | 69.07 | Common Sense Reasoning Average Score (%) | 97.7 |
| EuroEval Italian NLU - MultiNERD IT | 85.32 | Named entity recognition Score (%) | 97.4 |
| EuroEval French NLU - Eltec | 75.31 | Named entity recognition Score (%) | 97.1 |
| Medmarks - SuperGPQA Medicine Hard | 49.46 | Score (%) | 97.1 |
| EuroEval Swedish Knowledge | 84.63 | Knowledge Average Score (%) | 97 |
Interactive version: theaggregate.ai/model?slug=qwen-3-next-80b-a3b-thinking · How It Works · Data refreshed daily, snapshot 2026-09-05.