Claude Opus 4.5 (Thinking): benchmark results
Claude Opus 4.5 evaluated with thinking enabled. Provider: Anthropic. Released 2025-11-24. Access: API.
Unified ELO 1675 ± 1, rank #161 of 1761 rated models, from 119 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AA Omniscience - Software Engineering (SWE) - Go | 70 | Accuracy (%) | 100 |
| AA Omniscience - Software Engineering (SWE) - Julia | 68 | Accuracy (%) | 100 |
| AA Omniscience - Software Engineering (SWE) - PHP | 84 | Accuracy (%) | 100 |
| AA Omniscience - Software Engineering (SWE) - Python | 74.5 | Accuracy (%) | 100 |
| MCP-Atlas (Opus 4.6 System Card) | 62.3 | Score (%) | 100 |
| SWE-bench Verified (Opus 4.6 System Card) | 80.9 | Resolved (%) | 100 |
| AA Omniscience - Software Engineering (SWE) - C | 85 | Accuracy (%) | 99.7 |
| AA Omniscience - Software Engineering (SWE) - Java | 53 | Accuracy (%) | 99.7 |
| AA Omniscience - Software Engineering (SWE) - R | 64 | Accuracy (%) | 99.7 |
| AA MMLU-Pro | 89.45 | Accuracy (%) | 99.4 |
| AA Omniscience - Software Engineering (SWE) - Dart | 62 | Accuracy (%) | 99.3 |
| AA Omniscience - Software Engineering (SWE) - HTML | 78 | Accuracy (%) | 99.3 |
Interactive version: theaggregate.ai/model?slug=claude-opus-4-5-thinking · How It Works · Data refreshed daily, snapshot 2026-09-05.