Claude Opus 4 (Thinking 16K): benchmark results
Claude Opus 4 evaluated with a 16K-token thinking budget. Provider: Anthropic. Released 2025-05-22. Access: API.
Unified ELO 1614 ± 1, rank #371 of 1761 rated models, from 30 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Generalization V1 (Lechmazur) | 1.69 | Avg Rank (lower is better) | 98.8 |
| Confabulation Leaderboard (Lechmazur) | 2.48 | Confabulation rate % (lower is better) | 98.4 |
| Chatbot Arena (Text - Creative Writing) | 1432 | Arena Score | 85.4 |
| Chatbot Arena (Text - Longer Query) | 1466 | Arena Score | 84.9 |
| Chatbot Arena (Text - Instruction Following) | 1444 | Arena Score | 84.6 |
| Chatbot Arena (Text - Coding) | 1498 | Arena Score | 83 |
| Chatbot Arena (Text - German) | 1450 | Arena Score | 80.7 |
| Chatbot Arena (Text - Russian) | 1441 | Arena Score | 78.1 |
| Chatbot Arena (Text - Hard Prompts) | 1456 | Arena Score | 76.7 |
| Chatbot Arena (Text - Multi-Turn) | 1439 | Arena Score | 76.2 |
| Chatbot Arena (Text) | 1426 | Elo | 73.7 |
| Chatbot Arena (Text - English) | 1434 | Arena Score | 72.7 |
Interactive version: theaggregate.ai/model?slug=claude-opus-4-thinking-16k · How It Works · Data refreshed daily, snapshot 2026-09-05.