Claude Sonnet 4.5 — benchmark results

Anthropic Sonnet-tier Claude model for balanced reasoning, coding, and agentic tasks. Provider: Anthropic. Released 2025-09-29. Access: API.

Unified ELO 1741 ± 8, rank #210 of 1776 rated models, from 777 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
ABC-Bench63.2Overall pass@1 (self-reported)100
AGC-Bench - meta4xnli0.96Dataset z-score100
AGC-Bench - slang_generation1.52Dataset z-score100
AssertLLM228.32Coverage Formal (self-reported)100
CLEM PrivateShared98.7Game Clemscore (%)100
CodeClash1385ELO100
CodeClash - BattleSnake1470ELO100
CodeClash - Core War1641ELO100
CodeClash - Robot Rumble1423ELO100
Evals for Every Language - Language an56.84Average Score (%)100
Evals for Every Language - Language eo76.54Average Score (%)100
Evals for Every Language - Language ga75.44Average Score (%)100

Interactive version: theaggregate.ai/model?slug=claude-sonnet-4-5 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.