Claude Opus 4.1 (High) — benchmark results

Claude Opus 4.1 evaluated at the high reasoning-effort setting. Provider: Anthropic. Released 2025-08-05. Access: API.

Unified ELO 1787 ± 13, rank #154 of 1776 rated models, from 11 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
HAL GAIA68.48Accuracy (%)87.5
HAL GAIA Level 270.93Accuracy (%)87.5
HAL SciCode6.92Accuracy (%)80
HAL GAIA Level 353.85Accuracy (%)78.1
HAL SWE-bench Verified Mini54Score (%)76.5
HAL CORE-Bench Hard42.22Accuracy (%)75
HAL USACO51.47Accuracy (%)72.7
HAL GAIA Level 171.7Accuracy (%)71.9
HAL TAU-bench Airline52Accuracy (%)67.9
HAL AssistantBench13.75Accuracy (%)57.1
HAL ScienceAgentBench26.47Accuracy (%)46.7

Interactive version: theaggregate.ai/model?slug=claude-opus-4-1-high · How the rankings work · Data refreshed daily, snapshot 2026-07-22.