Claude Sonnet 4.5 (Thinking 32K): benchmark results

Claude Sonnet 4.5 evaluated with a 32K-token thinking budget. Provider: Anthropic. Released 2025-09-29. Access: API.

Unified ELO 1630 ± 1, rank #319 of 1761 rated models, from 13 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
MATH Level 597.73Accuracy (%)94.4
OTIS Mock AIME 2024-2577.78Accuracy (%)61.3
ARC-AGI-213.61Accuracy (%)52
FrontierMath - Tiers 1-315.22Accuracy (%, 290 problems)51.5
ARC-AGI-163.67Accuracy (%)50.5
VPCT39.8Accuracy (%)46.2
FrontierMath - Tier 44.17Accuracy (%, 48 problems)44.4
Chess Puzzles (Epoch AI)12Accuracy (%)43.6
FrontierMath - Tiers 1-3 (v2)23.86Accuracy (%, 285 private v2 problems)40.2
WebDev Arena1391Arena Score35.9
IUMB20.8Score (%)14.8
FrontierMath - Tier 4 (v2)2.44Accuracy (%, 41 private v2 problems)10.3

Interactive version: theaggregate.ai/model?slug=claude-sonnet-4-5-thinking-32k · How It Works · Data refreshed daily, snapshot 2026-09-05.