Claude Opus 4.7 (Max): benchmark results

Claude Opus 4.7 evaluated at the max reasoning-effort setting. Provider: Anthropic. Released 2026-04-16. Access: API.

Unified ELO 1712 ± 1, rank #80 of 1761 rated models, from 45 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
HWE-Bench (Claude Code)74.6Resolved (%)100
SuperCLUE-Writing - Content Quality90.77Score100
SuperCLUE-Writing - Overall87.97Score100
Vals AI SAGE56.1Accuracy (%)100
Vals AI MortgageTax70.27Accuracy (%)97.9
APEX-Agents50.6Mean Score (ReAct) (self-reported)95.5
Vals AI MMLU-Pro89.87Accuracy (%)94.9
Vals AI MedCode54.86Accuracy (%)94.4
Conceptual Reasoning Index - Argument Evaluation (LMCA)52.2Chance-Corrected Score (0-100)93.6
MedCode54.86Score (self-reported)93.2
SuperCLUE-Writing - Constrained Writing95.41Score92.3
Epoch AI - Dtbench94.65Score91.2

Interactive version: theaggregate.ai/model?slug=claude-opus-4-7-max · How It Works · Data refreshed daily, snapshot 2026-09-05.