Claude Sonnet 4.5 (Thinking 32K) — benchmark results

Claude Sonnet 4.5 evaluated with a 32K-token thinking budget. Provider: Anthropic. Released 2025-09-29. Access: API.

Unified ELO 1719 ± 43, rank #244 of 1776 rated models, from 17 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
MATH Level 597.73Accuracy (%)94.4
Chatbot Arena (Text)1456Elo88
Epoch AI - ECI146.76ECI Score63.7
ARC-AGI-213.61Accuracy (%)62
ARC-AGI-163.67Accuracy (%)60.9
OTIS Mock AIME 2024-2577.78Accuracy (%)60.9
Arena AI Code1388Arena ELO (self-reported)51.6
FrontierMath - Tiers 1-315.22Accuracy (%, 290 problems)51.5
VPCT39.8Accuracy (%)46.2
Chatbot Arena (Code)1388Elo44.4
FrontierMath - Tier 44.17Accuracy (%, 48 problems)44.4
WebDev Arena1391Arena Score43

Interactive version: theaggregate.ai/model?slug=claude-sonnet-4-5-thinking-32k · How the rankings work · Data refreshed daily, snapshot 2026-07-22.