Claude Opus 4.5 (Thinking): benchmark results

Claude Opus 4.5 evaluated with thinking enabled. Provider: Anthropic. Released 2025-11-24. Access: API.

Unified ELO 1675 ± 1, rank #161 of 1761 rated models, from 119 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA Omniscience - Software Engineering (SWE) - Go70Accuracy (%)100
AA Omniscience - Software Engineering (SWE) - Julia68Accuracy (%)100
AA Omniscience - Software Engineering (SWE) - PHP84Accuracy (%)100
AA Omniscience - Software Engineering (SWE) - Python74.5Accuracy (%)100
MCP-Atlas (Opus 4.6 System Card)62.3Score (%)100
SWE-bench Verified (Opus 4.6 System Card)80.9Resolved (%)100
AA Omniscience - Software Engineering (SWE) - C85Accuracy (%)99.7
AA Omniscience - Software Engineering (SWE) - Java53Accuracy (%)99.7
AA Omniscience - Software Engineering (SWE) - R64Accuracy (%)99.7
AA MMLU-Pro89.45Accuracy (%)99.4
AA Omniscience - Software Engineering (SWE) - Dart62Accuracy (%)99.3
AA Omniscience - Software Engineering (SWE) - HTML78Accuracy (%)99.3

Interactive version: theaggregate.ai/model?slug=claude-opus-4-5-thinking · How It Works · Data refreshed daily, snapshot 2026-09-05.