Claude Opus 4.5 (Non-reasoning): benchmark results

Claude Opus 4.5 evaluated with reasoning disabled. Provider: Anthropic. Released 2025-11-24. Access: API.

Unified ELO 1656 ± 1, rank #223 of 1761 rated models, from 57 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA Omniscience - Software Engineering (SWE) - Go66Accuracy (%)99.5
AA Omniscience - Software Engineering (SWE) - Julia56Accuracy (%)99.5
AA Omniscience - Software Engineering (SWE) - Swift76Accuracy (%)99.3
AA MMLU-Pro88.92Accuracy (%)98.9
AA Omniscience - Software Engineering (SWE) - R60Accuracy (%)98.8
AA Omniscience - Software Engineering (SWE) - Dart54Accuracy (%)98.6
AA Omniscience - Software Engineering (SWE) - Kotlin56Accuracy (%)98.6
AA Omniscience - Software Engineering (SWE) - Python64Accuracy (%)98.6
AA Omniscience - Software Engineering (SWE) - PHP74Accuracy (%)98.5
AA Omniscience - Software Engineering (SWE) - Java45Accuracy (%)98.3
AA Omniscience - Software Engineering (SWE) - JavaScript60Accuracy (%)98.3
AA Global-MMLU-Lite - Korean92.25Accuracy (%)98.2

Interactive version: theaggregate.ai/model?slug=claude-opus-4-5-non-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-05.