Claude Sonnet 5 (Max): benchmark results

Claude Sonnet 5 evaluated at the max reasoning-effort setting. Provider: Anthropic. Released 2026-06-30. Access: API.

Unified ELO 1686 ± 1, rank #139 of 1761 rated models, from 43 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Vals AI MortgageTax70.03Accuracy (%)96.9
Conceptual Reasoning Index - Argument Evaluation (LMCA)49.31Chance-Corrected Score (0-100)91.3
Vals AI Vibe Code Bench81.33Accuracy (%)91.2
Vals AI TaxEval v275.63Accuracy (%)90.6
Vals AI CorpFin v266.98Accuracy (%)89.5
Epoch AI - Mystery Game Puzzles35Score89.1
Epoch AI - Dtbench92.48Score88.1
ProofBench66Score (self-reported)87.7
Vals AI ProgramBench72.07Raw Pass Rate (%)86.4
Vals Index68.61Score (self-reported)84.6
FrontierMath - Tiers 1-3 (v2)65.61Accuracy (%, 285 private v2 problems)83.5
Vals AI (Vals Index)59.61Accuracy (%)83

Interactive version: theaggregate.ai/model?slug=claude-sonnet-5-max · How It Works · Data refreshed daily, snapshot 2026-09-05.