Claude Opus 4.5 (High) — benchmark results

Claude Opus 4.5 evaluated at the high reasoning-effort setting. Provider: Anthropic. Released 2025-11-24. Access: API.

Unified ELO 1732 ± 28, rank #219 of 1776 rated models, from 40 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
NonoBench56.7Overall Accuracy (%)93.6
MedScribe85.32Score (self-reported)86.5
MCPMark42.32Pass@1 (%)84.2
Finance Agent v1.158.81Score (self-reported)78.2
MedCode49.16Score (self-reported)77.4
Chess Bench LLM1124Lichess Rating75.8
HAL CORE-Bench Hard42.22Accuracy (%)75
IOI23.58Score (self-reported)69.8
Vals AI ProofBench36Accuracy (%)69.7
APEX-Agents34.8Mean Score (ReAct) (self-reported)62.8
VoxelBench1477Rating61.7
APEX v1 Medicine (MD)61.5Score (%)61.1

Interactive version: theaggregate.ai/model?slug=claude-opus-4-5-high · How the rankings work · Data refreshed daily, snapshot 2026-07-22.