Claude Opus 4.5 (20251101) (Thinking 32K) — benchmark results
Claude Opus 4.5 (20251101) evaluated with a 32K-token thinking budget. Provider: Anthropic. Released 2025-11-01. Access: API.
Unified ELO 1767 ± 45, rank #171 of 1776 rated models, from 9 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Chatbot Arena (Text) | 1473 | Elo | 93.8 |
| Arena AI Code | 1491 | Arena ELO (self-reported) | 90.5 |
| WebDev Arena | 1512 | Arena Score | 82.3 |
| Chatbot Arena (Code) | 1490 | Elo | 76.8 |
| OTIS Mock AIME 2024-25 | 86.11 | Accuracy (%) | 72.1 |
| LMArena WebDev Arena | 1490.6 | Arena rating (self-reported) | 70 |
| SimpleQA Verified | 41.8 | Accuracy (%) | 56.2 |
| VPCT | 40 | Accuracy (%) | 50 |
| Chess Puzzles (Epoch AI) | 12 | Accuracy (%) | 9.8 |
Interactive version: theaggregate.ai/model?slug=claude-opus-4-5-20251101-thinking-32k · How the rankings work · Data refreshed daily, snapshot 2026-07-22.