Claude Opus 4 (Thinking 16K): benchmark results

Claude Opus 4 evaluated with a 16K-token thinking budget. Provider: Anthropic. Released 2025-05-22. Access: API.

Unified ELO 1614 ± 1, rank #371 of 1761 rated models, from 30 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Generalization V1 (Lechmazur)1.69Avg Rank (lower is better)98.8
Confabulation Leaderboard (Lechmazur)2.48Confabulation rate % (lower is better)98.4
Chatbot Arena (Text - Creative Writing)1432Arena Score85.4
Chatbot Arena (Text - Longer Query)1466Arena Score84.9
Chatbot Arena (Text - Instruction Following)1444Arena Score84.6
Chatbot Arena (Text - Coding)1498Arena Score83
Chatbot Arena (Text - German)1450Arena Score80.7
Chatbot Arena (Text - Russian)1441Arena Score78.1
Chatbot Arena (Text - Hard Prompts)1456Arena Score76.7
Chatbot Arena (Text - Multi-Turn)1439Arena Score76.2
Chatbot Arena (Text)1426Elo73.7
Chatbot Arena (Text - English)1434Arena Score72.7

Interactive version: theaggregate.ai/model?slug=claude-opus-4-thinking-16k · How It Works · Data refreshed daily, snapshot 2026-09-05.