Claude Sonnet 4 (2025-05-14) (Thinking): benchmark results

Provider: Anthropic. Released 2025-05-22. Access: API.

Unified ELO 1625 ± 1, rank #359 of 1919 rated models, from 12 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
HELM Safety - Safety Scenarios98.07Mean score95.9
HELM Safety98.07Mean score (self-reported)95
HELM Safety - Harm Bench98LM Evaluated Safety score94.7
HELM Capabilities - GPQA70.63COT correct90
HELM Capabilities - Omni-MATH60.2Acc90
HELM Capabilities - MMLU-Pro84.3COT correct89
HELM Capabilities - WildBench83.81WB Score86
HELM Safety - Simple Safety Tests100LM Evaluated Safety score84.6
HELM Safety - Bbq96.6BBQ accuracy80.8
HELM Capabilities - IFEval84.01IFEval Strict Acc68
HELM Safety - Xstest96.61LM Evaluated Safety score63.9
HELM Safety - Anthropic Red Team99.15LM Evaluated Safety score61.5

Interactive version: theaggregate.ai/model?slug=claude-sonnet-4-2025-05-14-thinking · How It Works · Data refreshed daily, snapshot 2026-09-08.