Claude 3 Opus: benchmark results

Anthropic's flagship Claude 3 model from March 2024, API-only with a 200K context. Provider: Anthropic. Released 2024-03-04. Access: API.

Unified ELO 1505 ± 1, rank #666 of 1392 rated models, from 263 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
CRM LLM Leaderboard67.5CRM Accuracy (0-100)100
CZ-EVAL - Critical Thinking76.45Accuracy (%)100
CZ-EVAL - Culture92.45Accuracy (%)100
CZ-EVAL - Verbal80.18Accuracy (%)100
Deception Resistance (Lechmazur)0.28Vulnerability Score (lower is better)100
LingOly46.3Exact Match Accuracy100
VNTL Leaderboard74.59Accuracy (%)97.7
Vellum - GPQA95.4Accuracy (%)97.1
MathBench63Average Score93.9
Compl-AI Board84.9Average Compliance Score (%)92.9
Judge Arena1312ELO Score92.6
MixEval63.5Score92.2

Interactive version: theaggregate.ai/model?slug=claude-3-opus · How It Works · Data refreshed daily, snapshot 2026-09-05.