Claude Opus 4.6 (Max): benchmark results

Claude Opus 4.6 evaluated at the max reasoning-effort setting. Provider: Anthropic. Released 2026-02-05. Access: API.

Unified ELO 1691 ± 1, rank #128 of 1761 rated models, from 35 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
ATLAS70.55ATLAScore (self-reported)100
Conceptual Reasoning Index - Argument Evaluation (LMCA)55.76Chance-Corrected Score (0-100)97.1
VideoMME w sub.86.1Score (self-reported)92.7
FrontierMath - Tiers 1-340.7Accuracy (%, 290 problems)92.4
APEX-Agents48.4Mean Score (ReAct) (self-reported)92
HMMT February 202696.2Score (self-reported)87.5
FrontierMath - Tier 422.9Accuracy (%, 48 problems)87.3
Vals AI MedScribe86.74Accuracy (%)86.6
Epoch AI - Dtbench91.2Score85.9
FrontierMath - Tiers 1-3 (v2)65.96Accuracy (%, 285 private v2 problems)84.6
MathArena - APEX 202534.5Accuracy (%)80
MedXpertQA64.4Score (self-reported)80

Interactive version: theaggregate.ai/model?slug=claude-opus-4-6-max · How It Works · Data refreshed daily, snapshot 2026-09-05.