Claude Sonnet 4.6 (Max): benchmark results

Claude Sonnet 4.6 evaluated at the max reasoning-effort setting. Provider: Anthropic. Released 2026-02-17. Access: API.

Unified ELO 1669 ± 1, rank #181 of 1761 rated models, from 37 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Vals AI Finance Agent63.33Accuracy (%)98.3
Vals AI TaxEval v277.11Accuracy (%)97.9
Vals AI Terminal-Bench 2.059.55Accuracy (%)90.2
Conceptual Reasoning Index - Argument Evaluation (LMCA)46.51Chance-Corrected Score (0-100)88.4
Vals AI MMLU-Pro87.34Accuracy (%)79.6
Epoch AI - Dtbench89.87Score79.1
Vals AI MortgageTax67.73Accuracy (%)78.4
Vals AI CorpFin v265.31Accuracy (%)77.4
ProofBench45Score (self-reported)75.4
GENSTRAT64Alpha (chips/game) (self-reported)75
Vals AI Code Migration39.89Accuracy (%)74.5
ARC-AGI-258.33Accuracy (%)72.1

Interactive version: theaggregate.ai/model?slug=claude-sonnet-4-6-max · How It Works · Data refreshed daily, snapshot 2026-09-05.