Claude Opus 4.7: benchmark results

Anthropic's flagship Opus model for complex reasoning, coding, and writing tasks. Provider: Anthropic. Released 2026-04-16. Access: API.

Unified ELO 1709 ± 1, rank #44 of 1392 rated models, from 759 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AGC-Bench0.8Mean JRT z-score100
AGC-Bench - Humor1.09JRT z-score100
AGC-Bench - c3_crosstalk2.02Dataset z-score100
AGC-Bench - crowd_vote1.52Dataset z-score100
AGC-Bench - fig_qa2.5Dataset z-score100
AGC-Bench - grapheval_review_advisor1.77Dataset z-score100
AGC-Bench - metaphoric_analogies3.98Dataset z-score100
AcuityBench85.3QA Exact (self-reported)100
AgentCIBench13.7Leakage (self-reported)100
Biomni-Bench (Humanlaya)73.34Score (0-100)100
CVerifBench98.3Total (self-reported)100
CharXiv Reasoning (Anthropic No Tools)81.3Accuracy (%)100

Interactive version: theaggregate.ai/model?slug=claude-opus-4-7 · How It Works · Data refreshed daily, snapshot 2026-09-05.