Claude Opus 4.8 (xHigh): benchmark results

Claude Opus 4.8 evaluated at the xhigh reasoning-effort setting. Provider: Anthropic. Released 2026-05-29. Access: API.

Unified ELO 1713 ± 1, rank #77 of 1761 rated models, from 17 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
ProgramBench Almost16.5Almost (%)95
DuelLab Overall66.6DuelLab Score93.7
WeirdML82.89Average Score92.4
LiveBench77.55LiveBench average (self-reported)91.5
EnigmaEval23.51Score (self-reported)90
LLM2014 Logic 2026-0668.32Median Score90
LLM2014 Logic 2026-0568.32Median Score89.5
InferenceBench7.34Speedup Score82.3
Epoch AI - Mystery Game Puzzles31Score81.5
SWE-rebench56.55Resolved (%)79.2
Creative Writing (Lechmazur)1.1Mean Score71.3
CursorBench 3.159.4Score (%)52.7

Interactive version: theaggregate.ai/model?slug=claude-opus-4-8-xhigh · How It Works · Data refreshed daily, snapshot 2026-09-05.