Claude Sonnet 4 (20250514) (Thinking): benchmark results
Claude Sonnet 4 (20250514) evaluated with thinking enabled. Provider: Anthropic. Released 2025-05-14. Access: API.
Unified ELO 1559 ± 1, rank #599 of 1761 rated models, from 24 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| UGI - Writing | 62.31 | Writing Score | 93.9 |
| Web-Bench | 24.3 | Pass@1 (%) | 89.4 |
| UGI - Natural Intelligence | 47.43 | NatInt Score | 89.2 |
| Vals AI MATH 500 | 93.8 | Accuracy (%) | 78.2 |
| Vals AI MedQA | 92.71 | Accuracy (%) | 71.3 |
| Vals AI CorpFin v2 | 61.23 | Accuracy (%) | 57.9 |
| Vals AI MGSM | 90.87 | Accuracy (%) | 57.4 |
| WritingBench | 74.07 | Score (self-reported) | 57.4 |
| Vals AI TaxEval v2 | 72 | Accuracy (%) | 52.1 |
| Vals AI LegalBench | 82.06 | Accuracy (%) | 51.1 |
| Vals AI MMLU-Pro | 83.86 | Accuracy (%) | 49.6 |
| Vals AI AIME | 76.25 | Accuracy (%) | 47.4 |
Interactive version: theaggregate.ai/model?slug=claude-sonnet-4-20250514-thinking · How It Works · Data refreshed daily, snapshot 2026-09-05.