Claude Opus 4 (20250514) — benchmark results

May 14, 2025 Claude Opus 4 snapshot, tracked when sources report the dated API model. Provider: Anthropic. Released 2025-05-14. Access: API.

Unified ELO 1696 ± 13, rank #278 of 1776 rated models, from 62 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
HELM Safety BBQ99.3BBQ accuracy (%)100
Web-Bench28Pass@1 (%)100
RewardBench Factuality82.67Accuracy (%)98
RewardBench Math74.91Score (%)96.9
AraGen80.963C3H Score (%)95.5
RewardBench Ties83.75Score (%)95.3
HELM Capabilities - MMLU-Pro85.9COT correct95
HELM Capabilities - IFEval91.77IFEval Strict Acc94
WebApp1K Duo76.3Pass@1 (%)90.6
SuperGPQA61.43Accuracy (%)89.7
Vals AI MGSM93.78Accuracy (%)89.2
HindiGen74.493C3H Score (%)88.2

Interactive version: theaggregate.ai/model?slug=claude-opus-4-20250514 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.