Qwen3-Next-80B: benchmark results
Provider: Alibaba. Released 2025-09-09. Access: Open.
Unified ELO 1738 ± 39, rank #265 of 2656 rated models, from 32 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| XDomainBench | 63.8 | R (k=1, Deterministic) (self-reported) | 100 |
| FinRiskAtlas - Evidence-Grounded Processing - Institution Matching | 90.8 | Accuracy (%) | 96.9 |
| FinRiskAtlas - Domain Knowledge - Finance & Law | 82.08 | Macro-Averaged Accuracy (%) | 90.6 |
| FinRiskAtlas - FinRisk-Ask - Balanced Action Agreement | 56.21 | BAcc (%) | 90.6 |
| FinRiskAtlas - Evidence-Grounded Processing - Quantitative Reasoning | 80.17 | Numerical Accuracy (%) | 87.5 |
| ALL Bench LLM | 74.75 | Average Numeric Benchmark Score (%) | 84.2 |
| FLY-EVAL++ - Single-Step Prediction - Field Validity | 63.4 | S1 D2 field score (%) | 80 |
| FinRiskAtlas - Applied Review - Legal-Outcome Prediction | 65.71 | Accuracy (%) | 76.6 |
| FinRiskAtlas - Domain Knowledge - FinTech & Security | 82.52 | Macro-Averaged Accuracy (%) | 75 |
| FinRiskAtlas - Domain Knowledge - Overall | 77.19 | Macro-Averaged Accuracy (%) | 68.8 |
| FinRiskAtlas - Domain Knowledge - Risk & Compliance | 74.2 | Macro-Averaged Accuracy (%) | 65.6 |
| FinRiskAtlas - Evidence-Grounded Processing - Case Classification | 84.94 | Accuracy (%) | 65.6 |
Interactive version: theaggregate.ai/model?slug=qwen3-next-80b · How It Works · Data refreshed daily, snapshot 2026-09-19.