Claude Opus 4.7 (Max) — benchmark results

Claude Opus 4.7 evaluated at the max reasoning-effort setting. Provider: Anthropic. Released 2026-04-16. Access: API.

Unified ELO 2007 ± 42, rank #21 of 1776 rated models, from 17 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
ITBench-AA46.7Average Precision at Full Recall (self-reported)100
CritPt12Accuracy (self-reported)95.4
AA-LCR70.3Score (self-reported)95.3
MedCode54.86Score (self-reported)92.5
WeirdML75.45Average Score90.5
Epoch AI - ECI156.1ECI Score89.6
Epoch AI - Scicode54.51Score85.3
Epoch AI - Cursorbench64.8Score85.2
IOI47.08Score (self-reported)84.9
Epoch AI - Apex Agents33.9Score83.3
Vals AI ProofBench54Accuracy (%)81.5
MedScribe82.95Score (self-reported)75

Interactive version: theaggregate.ai/model?slug=claude-opus-4-7-max · How the rankings work · Data refreshed daily, snapshot 2026-07-22.