Claude Opus 4.1 (20250805): benchmark results
August 5, 2025 Claude Opus 4.1 snapshot, tracked when sources report the dated API model. Provider: Anthropic. Released 2025-08-05. Access: API.
Unified ELO 1653 ± 1, rank #125 of 1392 rated models, from 84 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| WebApp1K Duo | 76.9 | Pass@1 (%) | 95.8 |
| Vals AI MGSM | 94.22 | Accuracy (%) | 94.3 |
| HAL CORE-Bench Hard | 51.11 | Accuracy (%) | 92.3 |
| Chatbot Arena (Text - Spanish) | 1467 | Arena Score | 91 |
| Chatbot Arena (Text - Instruction Following) | 1455 | Arena Score | 88.2 |
| HAL SWE-bench Verified Mini | 61 | Score (%) | 88.2 |
| Chatbot Arena (Text - Creative Writing) | 1442 | Arena Score | 87.9 |
| Chatbot Arena (Text - Longer Query) | 1472 | Arena Score | 86.9 |
| HAL SciCode | 7.69 | Accuracy (%) | 86.7 |
| Chatbot Arena (Text - Multi-Turn) | 1469 | Arena Score | 86.6 |
| Chatbot Arena (Text - Coding) | 1505 | Arena Score | 86.2 |
| Chatbot Arena (Text - Hard Prompts) | 1477 | Arena Score | 85.6 |
Interactive version: theaggregate.ai/model?slug=claude-opus-4-1-20250805 · How It Works · Data refreshed daily, snapshot 2026-09-05.