Claude Opus 4.8 (High): benchmark results
Claude Opus 4.8 evaluated at the high reasoning-effort setting. Provider: Anthropic. Released 2026-05-29. Access: API.
Unified ELO 1702 ± 1, rank #98 of 1761 rated models, from 78 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| OpenCompass Reasoning - Common | 80.6 | Score (%) | 100 |
| SuperCLUE-SWE - Overall | 73.33 | Score | 100 |
| Chatbot Arena (Text - Instruction Following) | 1492 | Arena Score | 98.2 |
| Chatbot Arena (Text - Coding) | 1534 | Arena Score | 98.1 |
| FutureEval | 12.97 | Unified Forecasting Score | 97.8 |
| Chatbot Arena (Text - Hard Prompts) | 1515 | Arena Score | 97.7 |
| Chatbot Arena (Text - Longer Query) | 1502 | Arena Score | 97.7 |
| Chatbot Arena (Text - Multi-Turn) | 1497 | Arena Score | 97.7 |
| Chatbot Arena (Text - Russian) | 1495 | Arena Score | 97 |
| Chatbot Arena (Text - French) | 1509 | Arena Score | 96.9 |
| Chatbot Arena (Text - Spanish) | 1486 | Arena Score | 96.8 |
| Chatbot Arena (Text - Math) | 1496 | Arena Score | 96.3 |
Interactive version: theaggregate.ai/model?slug=claude-opus-4-8-high · How It Works · Data refreshed daily, snapshot 2026-09-05.