Claude Sonnet 4: benchmark results
Anthropic Claude Sonnet 4 model, the balanced Sonnet-tier Claude 4 row. Provider: Anthropic. Released 2025-05-22. Access: API.
Unified ELO 1635 ± 1, rank #164 of 1392 rated models, from 599 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Evals for Every Language - Language ars | 53.43 | Average Score (%) | 100 |
| FinVerBench | 100 | Accuracy (self-reported) | 100 |
| PrivacyPeek | 86.46 | TCR (self-reported) | 100 |
| RAI-Bench - RAG Robustness (LC Factuality) | 56 | Rate (%) | 100 |
| AGC-Bench - arn | 1.01 | Dataset z-score | 99.4 |
| RAI-Bench - RAG Robustness (LC Abstention) | 97 | Rate (%) | 99.3 |
| AGC-Bench - ocw | 1.79 | Dataset z-score | 98.8 |
| Evals for Every Language - Language af | 78.98 | Average Score (%) | 98.6 |
| Evals for Every Language - Language bn | 73.06 | Average Score (%) | 98.6 |
| Evals for Every Language - Language ko | 68.75 | Average Score (%) | 98.6 |
| Evals for Every Language - Language te | 74.59 | Average Score (%) | 98.6 |
| Evals for Every Language - Language zh | 68.85 | Average Score (%) | 98.6 |
Interactive version: theaggregate.ai/model?slug=claude-sonnet-4 · How It Works · Data refreshed daily, snapshot 2026-09-05.