Claude Opus 4.7 (Thinking): benchmark results

Claude Opus 4.7 evaluated with thinking enabled. Provider: Anthropic. Released 2026-04-16. Access: API.

Unified ELO 1727 ± 1, rank #57 of 1761 rated models, from 23 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Chinese Classical Bench - Char-Gloss Judge73.6Score (%)100
Chinese Classical Bench - Fill-In Exact88Score (%)100
Chinese Classical Bench - Translate Judge80.2Score (%)100
KnotBench54.6Accuracy (%) (self-reported)100
Wolfram LLM Benchmarking Project72.5Correct Functionality (%)99.8
ProfBench61.3Overall Rubric Score (%)99
Kagi LLM Benchmark80.7Accuracy (%)95.8
Design Arena (ASCII Art)1307Elo95.1
ALE-Bench1323.05Performance (Self-Refine x1) (self-reported)93.2
Design Arena (Data Viz)1306Elo92.9
Design Arena (Website)1309Elo92.5
Design Arena (UI Components)1329Elo92.2

Interactive version: theaggregate.ai/model?slug=claude-opus-4-7-thinking · How It Works · Data refreshed daily, snapshot 2026-09-05.