Claude Opus 4.8 (High): benchmark results

Claude Opus 4.8 evaluated at the high reasoning-effort setting. Provider: Anthropic. Released 2026-05-29. Access: API.

Unified ELO 1702 ± 1, rank #98 of 1761 rated models, from 78 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
OpenCompass Reasoning - Common80.6Score (%)100
SuperCLUE-SWE - Overall73.33Score100
Chatbot Arena (Text - Instruction Following)1492Arena Score98.2
Chatbot Arena (Text - Coding)1534Arena Score98.1
FutureEval12.97Unified Forecasting Score97.8
Chatbot Arena (Text - Hard Prompts)1515Arena Score97.7
Chatbot Arena (Text - Longer Query)1502Arena Score97.7
Chatbot Arena (Text - Multi-Turn)1497Arena Score97.7
Chatbot Arena (Text - Russian)1495Arena Score97
Chatbot Arena (Text - French)1509Arena Score96.9
Chatbot Arena (Text - Spanish)1486Arena Score96.8
Chatbot Arena (Text - Math)1496Arena Score96.3

Interactive version: theaggregate.ai/model?slug=claude-opus-4-8-high · How It Works · Data refreshed daily, snapshot 2026-09-05.