Claude Opus 4 (20250514): benchmark results

May 14, 2025 Claude Opus 4 snapshot, tracked when sources report the dated API model. Provider: Anthropic. Released 2025-05-14. Access: API.

Unified ELO 1632 ± 1, rank #175 of 1392 rated models, from 89 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
HELM Safety BBQ99.3BBQ accuracy (%)100
Web-Bench28Pass@1 (%)100
RewardBench Factuality82.67Accuracy (%)98
RewardBench Math74.91Score (%)96.9
AraGen80.963C3H Score (%)95.5
RewardBench Ties83.75Score (%)95.3
HELM Capabilities - MMLU-Pro85.9COT correct95
Enkrypt AI - Safety Risk16.79Risk Score94.3
HELM Capabilities - IFEval91.77IFEval Strict Acc94
Enkrypt AI - Jailbreak Risk1.97Risk Score93.1
WebApp1K Duo76.3Pass@1 (%)90.6
Vals AI MGSM93.78Accuracy (%)90.3

Interactive version: theaggregate.ai/model?slug=claude-opus-4-20250514 · How It Works · Data refreshed daily, snapshot 2026-09-05.