Claude Opus 4.8 (Adaptive Reasoning, Max Effort) — benchmark results

Claude Opus 4.8 evaluated in adaptive-reasoning mode at max effort. Provider: Anthropic. Released 2026-05-29. Access: API.

Unified ELO 1965 ± 36, rank #37 of 1776 rated models, from 40 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA Humanity's Last Exam45.74Accuracy (%)99.6
AA Omniscience27.43Score99.6
AA Omniscience - Software Engineering (SWE) - Swift88Accuracy (%)99.3
Artificial Analysis Intelligence Index55.69Intelligence Index99.1
AA Omniscience - Software Engineering (SWE) - Go80Accuracy (%)98
AA Terminal-Bench Hard58.33Accuracy (%)97.9
AA Omniscience - Software Engineering (SWE) - HTML82Accuracy (%)97.7
AA Omniscience - Software Engineering (SWE) - Rust82Accuracy (%)97.5
AA Omniscience - Software Engineering (SWE) - Dart68Accuracy (%)97.1
AA GPQA Diamond92.02Accuracy (%)96.8
AA Omniscience - Software Engineering (SWE) - JavaScript81.82Accuracy (%)96.8
UGI - Natural Intelligence65.39NatInt Score96.8

Interactive version: theaggregate.ai/model?slug=claude-opus-4-8-adaptive-reasoning-max-effort · How the rankings work · Data refreshed daily, snapshot 2026-07-22.