Claude Sonnet 5 — benchmark results

Anthropic Sonnet-tier Claude 5-family model for balanced reasoning, coding, and writing workloads. Provider: Anthropic. Released 2026-06-30. Access: API.

Unified ELO 1890 ± 16, rank #69 of 1776 rated models, from 106 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
LLM Stats (GDP.pdf)81.6Score (%)100
OmniaBench58.54Overall Pass@1 (%)100
Vellum - GPQA96.2Accuracy (%)100
Vals AI MortgageTax70.03Accuracy (%)98.8
SvelteBench100Average pass@1 (%)97.4
Vals AI Vibe Code Bench81.33Accuracy (%)95.7
Long-Horizon Terminal-Bench49.7Mean Score (%)95
EQ-Bench Longform Writing78.3Writing Score (0-100)93.9
FrontierCode38.8Main Score (self-reported)93.3
Vals AI ProgramBench72.07Raw Pass Rate (%)93.3
Vellum - Humanity's Last Exam57.4Accuracy (%)92.6
Android Bench76.2Score (%)91.7

Interactive version: theaggregate.ai/model?slug=claude-sonnet-5 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.