Claude Sonnet 5: benchmark results

Anthropic Sonnet-tier Claude 5-family model for balanced reasoning, coding, and writing workloads. Provider: Anthropic. Released 2026-06-30. Access: API.

Unified ELO 1689 ± 1, rank #69 of 1392 rated models, from 154 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
OmniaBench58.54Overall Pass@1 (%)100
Phare - Jailbreak Resistance86.84Score (%)100
Vellum - GPQA96.2Accuracy (%)100
Enkrypt AI - Risk Score9.21Risk Score99.6
Enkrypt AI - Safety Risk13.31Risk Score98.5
Enkrypt AI - Bias Risk29.46Risk Score98.1
Phare - Average Safety78.1Score (%)97
SvelteBench100Average pass@1 (%)96.9
Phare - Harm Resistance99.59Score (%)95.7
Long-Horizon Terminal-Bench49.7Mean Score (%)95
BenchmarkList ECI147.95Capability Index (ECI)94.4
LLM Stats Score48.52LLM Stats Score (conservative rating)94.3

Interactive version: theaggregate.ai/model?slug=claude-sonnet-5 · How It Works · Data refreshed daily, snapshot 2026-09-05.