Qwen3 Max (Max) — benchmark results
Provider: Alibaba. Released 2025-09-24. Access: API.
Unified ELO 1721 ± 40, rank #239 of 1841 rated models, from 25 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Disentangling Language Roles in Multilingual L | 84 | JointSuccess (self-reported) | 100 |
| BacktestBench | 61.84 | Overall Accuracy (OA) (self-reported) | 95.5 |
| WritingBench | 80.26 | Score (self-reported) | 89.4 |
| Every Act Has Its Price | 1004.4 | Care (self-reported) | 88.9 |
| PLawBench | 64.75 | Overall (self-reported) | 78.3 |
| CPCD-Bench | 4.23 | SR (LLM-as-a-Judge) (self-reported) | 76.9 |
| ATC Safety-Oriented Language Understanding Eval | 52.34 | Risk Score (self-reported) | 70 |
| Vals AI MGSM | 92.15 | Accuracy (%) | 66.1 |
| IDE-Bench | 65 | Pass@1 Accuracy (self-reported) | 64.3 |
| AA-LCR | 46.7 | Score (self-reported) | 61.8 |
| ComplexMCP | 31.2 | Success Rate (self-reported) | 60 |
| IndustryBench | 1.97 | Final (SV) (self-reported) | 56.2 |
Interactive version: theaggregate.ai/model?slug=qwen3-max-max · How It Works · Data refreshed daily, snapshot 2026-07-25.