Claude Opus 4.8 (High) — benchmark results

Claude Opus 4.8 evaluated at the high reasoning-effort setting. Provider: Anthropic. Released 2026-05-29. Access: API.

Unified ELO 1999 ± 38, rank #24 of 1776 rated models, from 18 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
LisanBench0.66Mean Path Length / Current Maximum96.6
ARC-AGI-272.08Accuracy (%)90.5
GRIPS-hard76Accuracy (%)88.5
Multi-turn Debate (Lechmazur)1668Bradley-Terry Rating87.5
ARC-AGI-31.52Accuracy (%)85.7
ARC-AGI-192Accuracy (%)85.4
GRIPS93.7Accuracy (%)84.6
PACT (Lechmazur)1562CMS Points84
LiveBench76.18LiveBench average (self-reported)83.3
Surface Evolver Bench87.5Mean Score (%)81.8
Surface Evolver Bench Pass Rate68.75Pass Rate (%)79.5
Vending-Bench 25787.43Money Balance ($)79.2

Interactive version: theaggregate.ai/model?slug=claude-opus-4-8-high · How the rankings work · Data refreshed daily, snapshot 2026-07-22.