Claude Opus 4.8 (Non-reasoning): benchmark results

Provider: Anthropic. Released 2026-05-28. Access: API.

Unified ELO 1753 ± 25, rank #253 of 2075 rated models, from 25 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
StudentBench - Practice Design0.96Expert tutor pairwise preference, Bradley-Terry score (pract83.3
WeirdML70.45Average Score81.4
SteerBench-Work - Pass^584.9Scenarios Correct in All 5 Trials (%)79.3
K-Bench (Therapeutic v0)97.81Overall (%, Therapeutic v0 prompt)67.7
ComboShoppingBench - Coupon Legality95.9Pass rate (%)66.7
StudentBench - Lesson Planning0.59Expert tutor pairwise preference, Bradley-Terry score (lesso66.7
K-Bench98.11Overall (%, Default v1 prompt)65.6
ComboShoppingBench - Coupon-ID Validity98.6Pass rate (%)64.3
K-Bench - Risk (Therapeutic v0)91.83Risk Score (%, Therapeutic v0 prompt)62.1
K-Bench - Risk92.39Risk Score (%, Default v1 prompt)59
SteerBench-Work86Mean Trial Accuracy (%)58.6
ComboShoppingBench - Claim Faithfulness78.7Pass rate (%; LLM-judged)54.8

Interactive version: theaggregate.ai/model?slug=claude-opus-4-8-non-reasoning · How It Works · Data refreshed daily, snapshot 2026-10-04.