Claude Opus 4.5 (20251101) (Thinking 32K): benchmark results

Claude Opus 4.5 (20251101) evaluated with a 32K-token thinking budget. Provider: Anthropic. Released 2025-11-01. Access: API.

Unified ELO 1671 ± 1, rank #177 of 1761 rated models, from 7 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
OTIS Mock AIME 2024-2586.11Accuracy (%)71.9
WebDev Arena1494.39Arena Score65
SimpleQA Verified45.7Accuracy (%)61
FrontierMath - Tiers 1-3 (v2)34.39Accuracy (%, 285 private v2 problems)54.3
VPCT40Accuracy (%)50
Chess Puzzles (Epoch AI)12Accuracy (%)43.6
FrontierMath - Tier 4 (v2)4.88Accuracy (%, 41 private v2 problems)19.1

Interactive version: theaggregate.ai/model?slug=claude-opus-4-5-20251101-thinking-32k · How It Works · Data refreshed daily, snapshot 2026-09-05.