Claude Opus 4.1 (20250805) — benchmark results

August 5, 2025 Claude Opus 4.1 snapshot, tracked when sources report the dated API model. Provider: Anthropic. Released 2025-08-05. Access: API.

Unified ELO 1723 ± 10, rank #233 of 1776 rated models, from 60 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
WebApp1K Duo76.9Pass@1 (%)95.8
Vals AI MGSM94.22Accuracy (%)94
HAL CORE-Bench Hard51.11Accuracy (%)92.3
HAL SWE-bench Verified Mini61Score (%)88.2
HAL SciCode7.69Accuracy (%)86.7
SEAL - MASK87.4Score84.8
Chatbot Arena (Text)1447Elo84.7
HAL TAU-bench Airline54Accuracy (%)82.1
Arabic Broad Leaderboard8.88Average Score (0-10)81.9
Vals AI MMLU-Pro87.21Accuracy (%)80.2
ForecastBench65.2Overall Score (higher is better)78.7
HAL GAIA Level 266.28Accuracy (%)75

Interactive version: theaggregate.ai/model?slug=claude-opus-4-1-20250805 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.