Claude Opus 4.5 (Non-reasoning): benchmark results
Claude Opus 4.5 evaluated with reasoning disabled. Provider: Anthropic. Released 2025-11-24. Access: API.
Unified ELO 1656 ± 1, rank #223 of 1761 rated models, from 57 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AA Omniscience - Software Engineering (SWE) - Go | 66 | Accuracy (%) | 99.5 |
| AA Omniscience - Software Engineering (SWE) - Julia | 56 | Accuracy (%) | 99.5 |
| AA Omniscience - Software Engineering (SWE) - Swift | 76 | Accuracy (%) | 99.3 |
| AA MMLU-Pro | 88.92 | Accuracy (%) | 98.9 |
| AA Omniscience - Software Engineering (SWE) - R | 60 | Accuracy (%) | 98.8 |
| AA Omniscience - Software Engineering (SWE) - Dart | 54 | Accuracy (%) | 98.6 |
| AA Omniscience - Software Engineering (SWE) - Kotlin | 56 | Accuracy (%) | 98.6 |
| AA Omniscience - Software Engineering (SWE) - Python | 64 | Accuracy (%) | 98.6 |
| AA Omniscience - Software Engineering (SWE) - PHP | 74 | Accuracy (%) | 98.5 |
| AA Omniscience - Software Engineering (SWE) - Java | 45 | Accuracy (%) | 98.3 |
| AA Omniscience - Software Engineering (SWE) - JavaScript | 60 | Accuracy (%) | 98.3 |
| AA Global-MMLU-Lite - Korean | 92.25 | Accuracy (%) | 98.2 |
Interactive version: theaggregate.ai/model?slug=claude-opus-4-5-non-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-05.