Claude Opus 4.6 — benchmark results

Anthropic Opus-tier Claude model focused on high-end reasoning, coding, and writing. Provider: Anthropic. Released 2026-02-05. Access: API.

Unified ELO 1862 ± 12, rank #92 of 1776 rated models, from 483 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AGC-Bench - poetmt1.55Dataset z-score100
AGC-Bench - sdat0.68Dataset z-score100
Arena AI Document1526Arena ELO (self-reported)100
AttuneBench54.3Composite (self-reported)100
AutoLab68Overall Score (self-reported)100
AutoMedBench69.69Average Overall Score (self-reported)100
CAR-bench58Avg Pass^3 (%)100
Chatbot Arena (Document)1510Elo100
Chatbot Arena (Search)1253Arena Score100
Claw-Eval-Live66.7Pass Rate (self-reported)100
ClawBench v161.4Reward Rate (%)100
ClawForge45.3Strict Acc. (self-reported)100

Interactive version: theaggregate.ai/model?slug=claude-opus-4-6 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.