Claude Sonnet 4.6 (Max) — benchmark results

Claude Sonnet 4.6 evaluated at the max reasoning-effort setting. Provider: Anthropic. Released 2026-02-17. Access: API.

Unified ELO 1944 ± 40, rank #43 of 1776 rated models, from 16 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Finance Agent v1.163.33Score (self-reported)96.4
AA-LCR70.7Score (self-reported)96.1
CritPt3.1Accuracy (self-reported)86.4
ARC-AGI-258.33Accuracy (%)79.8
Vals Index60.06Score (self-reported)79.2
Epoch AI - ECI153.18ECI Score78.7
ITBench-AA39.8Average Precision at Full Recall (self-reported)77.3
ARC-AGI-186Accuracy (%)76.1
GENSTRAT64Alpha (chips/game) (self-reported)75
Vals Multimodal Index60.57Score (self-reported)73.7
Vals AI ProofBench45Accuracy (%)73.6
APEX-Agents-AA28Pass@1 (self-reported)69.6

Interactive version: theaggregate.ai/model?slug=claude-sonnet-4-6-max · How the rankings work · Data refreshed daily, snapshot 2026-07-22.