Claude Opus 4.6 (Max) — benchmark results

Claude Opus 4.6 evaluated at the max reasoning-effort setting. Provider: Anthropic. Released 2026-02-05. Access: API.

Unified ELO 1873 ± 31, rank #85 of 1776 rated models, from 44 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
APEX v1 Medicine (MD)71.6Score (%)100
ATLAS70.55ATLAScore (self-reported)100
AA-LCR70.7Score (self-reported)96.1
CritPt12.6Accuracy (self-reported)95.7
VideoMME w sub.86.1Score (self-reported)92.7
FrontierMath - Tiers 1-340.7Accuracy (%, 290 problems)92.4
MedScribe86.74Score (self-reported)92.3
APEX v1 Big Law76.2Score (%)88.9
Finance Agent v1.160.05Score (self-reported)87.3
FrontierMath - Tier 422.9Accuracy (%, 48 problems)87.3
APEX-Agents-AA33Pass@1 (self-reported)87
HMMT February 202696.2Score (self-reported)87

Interactive version: theaggregate.ai/model?slug=claude-opus-4-6-max · How the rankings work · Data refreshed daily, snapshot 2026-07-22.