Claude 3 Opus — benchmark results

Anthropic's flagship Claude 3 model from March 2024, API-only with a 200K context. Provider: Anthropic. Released 2024-03-04. Access: API.

Unified ELO 1425 ± 11, rank #1105 of 1776 rated models, from 278 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
CRM LLM Leaderboard67.5CRM Accuracy (0-100)100
CZ-EVAL - Critical Thinking76.45Accuracy (%)100
CZ-EVAL - Culture92.45Accuracy (%)100
CZ-EVAL - Verbal80.18Accuracy (%)100
Deception Resistance (Lechmazur)0.28Vulnerability Score (lower is better)100
LingOly46.3Exact Match Accuracy100
Vellum - GPQA95.4Accuracy (%)98.4
VNTL Leaderboard74.59Accuracy (%)97.7
InfiBench63.89Score (%)97.1
RepoQA90.6Score (self-reported)96.9
MathBench63Average Score93.9
Compl-AI Board84.9Average Compliance Score (%)92.9

Interactive version: theaggregate.ai/model?slug=claude-3-opus · How the rankings work · Data refreshed daily, snapshot 2026-07-22.