Claude Sonnet 4.5 (Thinking 16K): benchmark results

Claude Sonnet 4.5 evaluated with a 16K-token thinking budget. Provider: Anthropic. Released 2025-09-29. Access: API.

Unified ELO 1622 ± 1, rank #349 of 1761 rated models, from 8 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Elimination Game (Lechmazur)5.19TrueSkill μ83.1
Step Game (Lechmazur)3.37TrueSkill μ81.1
WeirdML47.71Average Score56.7
OTIS Mock AIME 2024-2571.11Accuracy (%)56.2
ARC-AGI-26.94Accuracy (%)45.3
ARC-AGI-148.33Accuracy (%)39.1
NYT Connections Extended43Score (%)38.5
IUMB8.3Score (%)3.7

Interactive version: theaggregate.ai/model?slug=claude-sonnet-4-5-thinking-16k · How It Works · Data refreshed daily, snapshot 2026-09-05.