Claude Sonnet 4.6 (Max): benchmark results
Claude Sonnet 4.6 evaluated at the max reasoning-effort setting. Provider: Anthropic. Released 2026-02-17. Access: API.
Unified ELO 1669 ± 1, rank #181 of 1761 rated models, from 37 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Vals AI Finance Agent | 63.33 | Accuracy (%) | 98.3 |
| Vals AI TaxEval v2 | 77.11 | Accuracy (%) | 97.9 |
| Vals AI Terminal-Bench 2.0 | 59.55 | Accuracy (%) | 90.2 |
| Conceptual Reasoning Index - Argument Evaluation (LMCA) | 46.51 | Chance-Corrected Score (0-100) | 88.4 |
| Vals AI MMLU-Pro | 87.34 | Accuracy (%) | 79.6 |
| Epoch AI - Dtbench | 89.87 | Score | 79.1 |
| Vals AI MortgageTax | 67.73 | Accuracy (%) | 78.4 |
| Vals AI CorpFin v2 | 65.31 | Accuracy (%) | 77.4 |
| ProofBench | 45 | Score (self-reported) | 75.4 |
| GENSTRAT | 64 | Alpha (chips/game) (self-reported) | 75 |
| Vals AI Code Migration | 39.89 | Accuracy (%) | 74.5 |
| ARC-AGI-2 | 58.33 | Accuracy (%) | 72.1 |
Interactive version: theaggregate.ai/model?slug=claude-sonnet-4-6-max · How It Works · Data refreshed daily, snapshot 2026-09-05.