Qwen 3 Next 80B A3B (Thinking) — benchmark results
Alibaba Qwen 3 Next 80B A3B evaluated with thinking enabled. Provider: Alibaba. Released 2025-09-11. Access: Open.
Unified ELO 1614 ± 8, rank #447 of 1776 rated models, from 315 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Medmarks - Med-HALT Reasoning NOTA | 78.86 | Score (%) | 100 |
| EuroEval Lithuanian Knowledge | 87.51 | Knowledge Average Score (%) | 99.5 |
| Medmarks - M-ARC | 75 | Score (%) | 98.6 |
| RewardBench 2 Safety | 94.89 | Accuracy (%) | 98 |
| EuroEval Polish Common Sense Reasoning | 69.07 | Common Sense Reasoning Average Score (%) | 97.7 |
| EuroEval Italian NLU - MultiNERD IT | 85.32 | Named entity recognition Score (%) | 97.4 |
| BRIDGE Medical Leaderboard - CoT | 42.9 | Average Performance (%) | 97.2 |
| EuroEval French NLU - Eltec | 75.31 | Named entity recognition Score (%) | 97.1 |
| Medmarks - SuperGPQA Medicine Hard | 49.46 | Score (%) | 97.1 |
| EuroEval Swedish Knowledge | 84.63 | Knowledge Average Score (%) | 97 |
| EuroEval Spanish Knowledge | 84.37 | Knowledge Average Score (%) | 96.6 |
| EuroEval Dutch NLU - CoNLL NL | 75.09 | Named entity recognition Score (%) | 96.5 |
Interactive version: theaggregate.ai/model?slug=qwen-3-next-80b-a3b-thinking · How the rankings work · Data refreshed daily, snapshot 2026-07-22.