Claude Sonnet 4.5 — benchmark results
Anthropic Sonnet-tier Claude model for balanced reasoning, coding, and agentic tasks. Provider: Anthropic. Released 2025-09-29. Access: API.
Unified ELO 1741 ± 8, rank #210 of 1776 rated models, from 777 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| ABC-Bench | 63.2 | Overall pass@1 (self-reported) | 100 |
| AGC-Bench - meta4xnli | 0.96 | Dataset z-score | 100 |
| AGC-Bench - slang_generation | 1.52 | Dataset z-score | 100 |
| AssertLLM2 | 28.32 | Coverage Formal (self-reported) | 100 |
| CLEM PrivateShared | 98.7 | Game Clemscore (%) | 100 |
| CodeClash | 1385 | ELO | 100 |
| CodeClash - BattleSnake | 1470 | ELO | 100 |
| CodeClash - Core War | 1641 | ELO | 100 |
| CodeClash - Robot Rumble | 1423 | ELO | 100 |
| Evals for Every Language - Language an | 56.84 | Average Score (%) | 100 |
| Evals for Every Language - Language eo | 76.54 | Average Score (%) | 100 |
| Evals for Every Language - Language ga | 75.44 | Average Score (%) | 100 |
Interactive version: theaggregate.ai/model?slug=claude-sonnet-4-5 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.