Claude Opus 4.1 (20250805): benchmark results

August 5, 2025 Claude Opus 4.1 snapshot, tracked when sources report the dated API model. Provider: Anthropic. Released 2025-08-05. Access: API.

Unified ELO 1653 ± 1, rank #125 of 1392 rated models, from 84 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
WebApp1K Duo76.9Pass@1 (%)95.8
Vals AI MGSM94.22Accuracy (%)94.3
HAL CORE-Bench Hard51.11Accuracy (%)92.3
Chatbot Arena (Text - Spanish)1467Arena Score91
Chatbot Arena (Text - Instruction Following)1455Arena Score88.2
HAL SWE-bench Verified Mini61Score (%)88.2
Chatbot Arena (Text - Creative Writing)1442Arena Score87.9
Chatbot Arena (Text - Longer Query)1472Arena Score86.9
HAL SciCode7.69Accuracy (%)86.7
Chatbot Arena (Text - Multi-Turn)1469Arena Score86.6
Chatbot Arena (Text - Coding)1505Arena Score86.2
Chatbot Arena (Text - Hard Prompts)1477Arena Score85.6

Interactive version: theaggregate.ai/model?slug=claude-opus-4-1-20250805 · How It Works · Data refreshed daily, snapshot 2026-09-05.