Claude Sonnet 4 (20250514) (Thinking): benchmark results

Claude Sonnet 4 (20250514) evaluated with thinking enabled. Provider: Anthropic. Released 2025-05-14. Access: API.

Unified ELO 1559 ± 1, rank #599 of 1761 rated models, from 24 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
UGI - Writing62.31Writing Score93.9
Web-Bench24.3Pass@1 (%)89.4
UGI - Natural Intelligence47.43NatInt Score89.2
Vals AI MATH 50093.8Accuracy (%)78.2
Vals AI MedQA92.71Accuracy (%)71.3
Vals AI CorpFin v261.23Accuracy (%)57.9
Vals AI MGSM90.87Accuracy (%)57.4
WritingBench74.07Score (self-reported)57.4
Vals AI TaxEval v272Accuracy (%)52.1
Vals AI LegalBench82.06Accuracy (%)51.1
Vals AI MMLU-Pro83.86Accuracy (%)49.6
Vals AI AIME76.25Accuracy (%)47.4

Interactive version: theaggregate.ai/model?slug=claude-sonnet-4-20250514-thinking · How It Works · Data refreshed daily, snapshot 2026-09-05.