Claude Sonnet 4 — benchmark results

Anthropic Claude Sonnet 4 model, the balanced Sonnet-tier Claude 4 row. Provider: Anthropic. Released 2025-05-22. Access: API.

Unified ELO 1688 ± 8, rank #296 of 1776 rated models, from 557 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Evals for Every Language - Language ars53.43Average Score (%)100
FinVerBench100Accuracy (self-reported)100
PrivacyPeek86.46TCR (self-reported)100
WildAgtEval67.5Complexity-Injected API Call Accuracy (self-reported)100
AGC-Bench - arn1.01Dataset z-score99.4
AGC-Bench - ocw1.79Dataset z-score98.8
Evals for Every Language - Language af78.98Average Score (%)98.6
Evals for Every Language - Language bn73.06Average Score (%)98.6
Evals for Every Language - Language ko68.75Average Score (%)98.6
Evals for Every Language - Language te74.59Average Score (%)98.6
Evals for Every Language - Language zh68.85Average Score (%)98.6
Wordle Arena100Win Rate (%)97.9

Interactive version: theaggregate.ai/model?slug=claude-sonnet-4 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.