Claude Opus 4.7 (Thinking) — benchmark results

Claude Opus 4.7 evaluated with thinking enabled. Provider: Anthropic. Released 2026-04-16. Access: API.

Unified ELO 1889 ± 25, rank #70 of 1776 rated models, from 29 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Chinese Classical Bench - Char-Gloss Judge73.6Score (%)100
Chinese Classical Bench - Fill-In Exact88Score (%)100
Chinese Classical Bench - Translate Judge80.2Score (%)100
ProfBench61.3Overall Rubric Score (%)100
Wolfram LLM Benchmarking Project72.5Correct Functionality (%)99.8
Chatbot Arena (Text)1502Elo99.5
Chatbot Arena (Vision)1306Arena Score99.3
Design Arena (UI Components)1345Elo97.8
Design Arena (Game Dev)1336Elo96.4
Kagi LLM Benchmark80.7Accuracy (%)95.7
Design Arena (Website)1322Elo95.5
Chatbot Arena (Code)1559Elo94.9

Interactive version: theaggregate.ai/model?slug=claude-opus-4-7-thinking · How the rankings work · Data refreshed daily, snapshot 2026-07-22.