Claude Opus 4.5 (20251101) (Thinking 32K) — benchmark results

Claude Opus 4.5 (20251101) evaluated with a 32K-token thinking budget. Provider: Anthropic. Released 2025-11-01. Access: API.

Unified ELO 1767 ± 45, rank #171 of 1776 rated models, from 9 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Chatbot Arena (Text)1473Elo93.8
Arena AI Code1491Arena ELO (self-reported)90.5
WebDev Arena1512Arena Score82.3
Chatbot Arena (Code)1490Elo76.8
OTIS Mock AIME 2024-2586.11Accuracy (%)72.1
LMArena WebDev Arena1490.6Arena rating (self-reported)70
SimpleQA Verified41.8Accuracy (%)56.2
VPCT40Accuracy (%)50
Chess Puzzles (Epoch AI)12Accuracy (%)9.8

Interactive version: theaggregate.ai/model?slug=claude-opus-4-5-20251101-thinking-32k · How the rankings work · Data refreshed daily, snapshot 2026-07-22.