Claude Opus 4.8 (xHigh) — benchmark results

Claude Opus 4.8 evaluated at the xhigh reasoning-effort setting. Provider: Anthropic. Released 2026-05-29. Access: API.

Unified ELO 1984 ± 26, rank #30 of 1776 rated models, from 13 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
WeirdML82.89Average Score96.4
LiveBench77.55LiveBench average (self-reported)90.5
LLM2014 Logic 2026-0668.32Median Score90
LLM2014 Logic 2026-0766.7Median Score90
LLM2014 Logic 2026-0568.32Median Score89.5
SWE-rebench56.55Resolved (%)85.6
FrontierCode34.3Main Score (self-reported)83.3
InferenceBench7.34Speedup Score81.8
Creative Writing (Lechmazur)1.3Mean Score72.4
Epoch AI - Cursorbench62.1Score70.4
AutomationBench15.5Pass Rate (%)55.6
Aikido CVE Rediscovery (pass@3)69.2Recall (%)45.7

Interactive version: theaggregate.ai/model?slug=claude-opus-4-8-xhigh · How the rankings work · Data refreshed daily, snapshot 2026-07-22.