Qwen3 Max (Max) — benchmark results

Provider: Alibaba. Released 2025-09-24. Access: API.

Unified ELO 1721 ± 40, rank #239 of 1841 rated models, from 25 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Disentangling Language Roles in Multilingual L84JointSuccess (self-reported)100
BacktestBench61.84Overall Accuracy (OA) (self-reported)95.5
WritingBench80.26Score (self-reported)89.4
Every Act Has Its Price1004.4Care (self-reported)88.9
PLawBench64.75Overall (self-reported)78.3
CPCD-Bench4.23SR (LLM-as-a-Judge) (self-reported)76.9
ATC Safety-Oriented Language Understanding Eval52.34Risk Score (self-reported)70
Vals AI MGSM92.15Accuracy (%)66.1
IDE-Bench65Pass@1 Accuracy (self-reported)64.3
AA-LCR46.7Score (self-reported)61.8
ComplexMCP31.2Success Rate (self-reported)60
IndustryBench1.97Final (SV) (self-reported)56.2

Interactive version: theaggregate.ai/model?slug=qwen3-max-max · How It Works · Data refreshed daily, snapshot 2026-07-25.