Claude Opus 4.5 (Non-reasoning) — benchmark results

Claude Opus 4.5 evaluated with reasoning disabled. Provider: Anthropic. Released 2025-11-24. Access: API.

Unified ELO 1797 ± 28, rank #143 of 1776 rated models, from 58 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA MMLU-Pro88.92Accuracy (%)98.8
AA Global-MMLU-Lite - Korean92.25Accuracy (%)98.3
AA Omniscience - Software Engineering (SWE) - Swift84Accuracy (%)98.1
AA Global-MMLU-Lite - English94.17Accuracy (%)97.5
AA Global-MMLU-Lite - Hindi91.08Accuracy (%)97
AA Global-MMLU-Lite - Spanish93.83Accuracy (%)96.6
AA Global-MMLU-Lite - Arabic90.92Accuracy (%)95.8
AA Omniscience - Software Engineering (SWE) - R60Accuracy (%)94.4
AA Omniscience - Software Engineering (SWE) - PHP74Accuracy (%)94.2
AA Global-MMLU-Lite - Indonesian92Accuracy (%)94
AA Global-MMLU-Lite - Japanese91.67Accuracy (%)93.9
AA Omniscience - Software Engineering (SWE) - Rust78Accuracy (%)93.9

Interactive version: theaggregate.ai/model?slug=claude-opus-4-5-non-reasoning · How the rankings work · Data refreshed daily, snapshot 2026-07-22.