Claude Sonnet 4.5 20250929 (Thinking): benchmark results

Provider: Anthropic. Released 2025-09-29. Access: API.

Unified ELO 1650 ± 1, rank #245 of 1761 rated models, from 7 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Vals AI MGSM94.33Accuracy (%)96
Vals AI MedScribe84.1Accuracy (%)68.6
MedCode44.13Score (self-reported)67.6
Vals AI Finance Agent54.5Accuracy (%)67.5
Vals AI CaseLaw v262.16Accuracy (%)66.9
Vals AI IOI18.33Accuracy (%)61.3
ProofBench19Score (self-reported)49.1

Interactive version: theaggregate.ai/model?slug=claude-sonnet-4-5-20250929-thinking · How It Works · Data refreshed daily, snapshot 2026-09-05.