Claude Sonnet 4: benchmark results

Anthropic Claude Sonnet 4 model, the balanced Sonnet-tier Claude 4 row. Provider: Anthropic. Released 2025-05-22. Access: API.

Unified ELO 1635 ± 1, rank #164 of 1392 rated models, from 599 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Evals for Every Language - Language ars53.43Average Score (%)100
FinVerBench100Accuracy (self-reported)100
PrivacyPeek86.46TCR (self-reported)100
RAI-Bench - RAG Robustness (LC Factuality)56Rate (%)100
AGC-Bench - arn1.01Dataset z-score99.4
RAI-Bench - RAG Robustness (LC Abstention)97Rate (%)99.3
AGC-Bench - ocw1.79Dataset z-score98.8
Evals for Every Language - Language af78.98Average Score (%)98.6
Evals for Every Language - Language bn73.06Average Score (%)98.6
Evals for Every Language - Language ko68.75Average Score (%)98.6
Evals for Every Language - Language te74.59Average Score (%)98.6
Evals for Every Language - Language zh68.85Average Score (%)98.6

Interactive version: theaggregate.ai/model?slug=claude-sonnet-4 · How It Works · Data refreshed daily, snapshot 2026-09-05.