Claude Sonnet 4.5 (Thinking 32K) — benchmark results
Claude Sonnet 4.5 evaluated with a 32K-token thinking budget. Provider: Anthropic. Released 2025-09-29. Access: API.
Unified ELO 1719 ± 43, rank #244 of 1776 rated models, from 17 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| MATH Level 5 | 97.73 | Accuracy (%) | 94.4 |
| Chatbot Arena (Text) | 1456 | Elo | 88 |
| Epoch AI - ECI | 146.76 | ECI Score | 63.7 |
| ARC-AGI-2 | 13.61 | Accuracy (%) | 62 |
| ARC-AGI-1 | 63.67 | Accuracy (%) | 60.9 |
| OTIS Mock AIME 2024-25 | 77.78 | Accuracy (%) | 60.9 |
| Arena AI Code | 1388 | Arena ELO (self-reported) | 51.6 |
| FrontierMath - Tiers 1-3 | 15.22 | Accuracy (%, 290 problems) | 51.5 |
| VPCT | 39.8 | Accuracy (%) | 46.2 |
| Chatbot Arena (Code) | 1388 | Elo | 44.4 |
| FrontierMath - Tier 4 | 4.17 | Accuracy (%, 48 problems) | 44.4 |
| WebDev Arena | 1391 | Arena Score | 43 |
Interactive version: theaggregate.ai/model?slug=claude-sonnet-4-5-thinking-32k · How the rankings work · Data refreshed daily, snapshot 2026-07-22.