Claude Opus 4.6: benchmark results

Anthropic Opus-tier Claude model focused on high-end reasoning, coding, and writing. Provider: Anthropic. Released 2026-02-05. Access: API.

Unified ELO 1699 ± 1, rank #53 of 1392 rated models, from 616 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AGC-Bench - poetmt1.55Dataset z-score100
AGC-Bench - sdat0.68Dataset z-score100
AcademiClaw71.9Pass Rate (self-reported)100
AttuneBench54.3Composite (self-reported)100
AutoLab68Overall Score (self-reported)100
AutoMedBench69.69Average Overall Score (self-reported)100
CAR-bench58Avg Pass^3 (%)100
Claw-Eval-Live66.7Pass Rate (self-reported)100
ClawBench v161.4Reward Rate (%)100
ClawForge45.3Strict Acc. (self-reported)100
CodeRouterBench43.83Mean Task Score (%)100
ContractBench77.8SR% (self-reported)100

Interactive version: theaggregate.ai/model?slug=claude-opus-4-6 · How It Works · Data refreshed daily, snapshot 2026-09-05.