Claude Sonnet 4.5 (Thinking 32K): benchmark results
Claude Sonnet 4.5 evaluated with a 32K-token thinking budget. Provider: Anthropic. Released 2025-09-29. Access: API.
Unified ELO 1630 ± 1, rank #319 of 1761 rated models, from 13 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| MATH Level 5 | 97.73 | Accuracy (%) | 94.4 |
| OTIS Mock AIME 2024-25 | 77.78 | Accuracy (%) | 61.3 |
| ARC-AGI-2 | 13.61 | Accuracy (%) | 52 |
| FrontierMath - Tiers 1-3 | 15.22 | Accuracy (%, 290 problems) | 51.5 |
| ARC-AGI-1 | 63.67 | Accuracy (%) | 50.5 |
| VPCT | 39.8 | Accuracy (%) | 46.2 |
| FrontierMath - Tier 4 | 4.17 | Accuracy (%, 48 problems) | 44.4 |
| Chess Puzzles (Epoch AI) | 12 | Accuracy (%) | 43.6 |
| FrontierMath - Tiers 1-3 (v2) | 23.86 | Accuracy (%, 285 private v2 problems) | 40.2 |
| WebDev Arena | 1391 | Arena Score | 35.9 |
| IUMB | 20.8 | Score (%) | 14.8 |
| FrontierMath - Tier 4 (v2) | 2.44 | Accuracy (%, 41 private v2 problems) | 10.3 |
Interactive version: theaggregate.ai/model?slug=claude-sonnet-4-5-thinking-32k · How It Works · Data refreshed daily, snapshot 2026-09-05.