Claude Sonnet 4 — benchmark results
Anthropic Claude Sonnet 4 model, the balanced Sonnet-tier Claude 4 row. Provider: Anthropic. Released 2025-05-22. Access: API.
Unified ELO 1688 ± 8, rank #296 of 1776 rated models, from 557 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Evals for Every Language - Language ars | 53.43 | Average Score (%) | 100 |
| FinVerBench | 100 | Accuracy (self-reported) | 100 |
| PrivacyPeek | 86.46 | TCR (self-reported) | 100 |
| WildAgtEval | 67.5 | Complexity-Injected API Call Accuracy (self-reported) | 100 |
| AGC-Bench - arn | 1.01 | Dataset z-score | 99.4 |
| AGC-Bench - ocw | 1.79 | Dataset z-score | 98.8 |
| Evals for Every Language - Language af | 78.98 | Average Score (%) | 98.6 |
| Evals for Every Language - Language bn | 73.06 | Average Score (%) | 98.6 |
| Evals for Every Language - Language ko | 68.75 | Average Score (%) | 98.6 |
| Evals for Every Language - Language te | 74.59 | Average Score (%) | 98.6 |
| Evals for Every Language - Language zh | 68.85 | Average Score (%) | 98.6 |
| Wordle Arena | 100 | Win Rate (%) | 97.9 |
Interactive version: theaggregate.ai/model?slug=claude-sonnet-4 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.