Claude Opus 4.6 (High): benchmark results

Claude Opus 4.6 evaluated at the high reasoning-effort setting. Provider: Anthropic. Released 2026-02-05. Access: API.

Unified ELO 1718 ± 1, rank #66 of 1761 rated models, from 68 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
CTI-REALM0.64Normalized Reward100
Chatbot Arena (Text - English)1514Arena Score100
Chatbot Arena (Text - Instruction Following)1514Arena Score100
Chatbot Arena (Text - Longer Query)1524Arena Score100
DeepResearchBench55.3Average Score100
Chatbot Arena (Text - Coding)1552Arena Score99.9
Chatbot Arena (Text - Hard Prompts)1533Arena Score99.9
Chatbot Arena (Text - Multi-Turn)1518Arena Score99.9
Chatbot Arena (Text - Creative Writing)1500Arena Score99.7
Chatbot Arena (Text - German)1510Arena Score99.7
Chatbot Arena (Text)1505Elo99.7
Chatbot Arena (Text - Math)1517Arena Score99

Interactive version: theaggregate.ai/model?slug=claude-opus-4-6-high · How It Works · Data refreshed daily, snapshot 2026-09-05.