Claude Sonnet 5 — benchmark results
Anthropic Sonnet-tier Claude 5-family model for balanced reasoning, coding, and writing workloads. Provider: Anthropic. Released 2026-06-30. Access: API.
Unified ELO 1890 ± 16, rank #69 of 1776 rated models, from 106 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| LLM Stats (GDP.pdf) | 81.6 | Score (%) | 100 |
| OmniaBench | 58.54 | Overall Pass@1 (%) | 100 |
| Vellum - GPQA | 96.2 | Accuracy (%) | 100 |
| Vals AI MortgageTax | 70.03 | Accuracy (%) | 98.8 |
| SvelteBench | 100 | Average pass@1 (%) | 97.4 |
| Vals AI Vibe Code Bench | 81.33 | Accuracy (%) | 95.7 |
| Long-Horizon Terminal-Bench | 49.7 | Mean Score (%) | 95 |
| EQ-Bench Longform Writing | 78.3 | Writing Score (0-100) | 93.9 |
| FrontierCode | 38.8 | Main Score (self-reported) | 93.3 |
| Vals AI ProgramBench | 72.07 | Raw Pass Rate (%) | 93.3 |
| Vellum - Humanity's Last Exam | 57.4 | Accuracy (%) | 92.6 |
| Android Bench | 76.2 | Score (%) | 91.7 |
Interactive version: theaggregate.ai/model?slug=claude-sonnet-5 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.