Claude Opus 4.6 (Medium): benchmark results

Claude Opus 4.6 evaluated at the medium reasoning-effort setting. Provider: Anthropic. Released 2026-02-05. Access: API.

Unified ELO 1689 ± 1, rank #181 of 3078 rated models, from 18 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
BeQu - Experiment 1 - Entailment F147.2Entailment F1 (%)100
MageBench S11747Rating100
MageBench Season 11747Rating (self-reported)100
BeQu - Experiment 1 - Entailment Recall39.2Entailment Recall (%)94.7
NVIDIA ComputeEval - Math Libs91.1Pass@1 (%, zero-shot, 2026.1 release, 101 problems)94.7
NVIDIA ComputeEval - cuDNN36.3Pass@1 (%, zero-shot, 2026.1 release, 113 problems)94.7
NVIDIA ComputeEval68.6Pass@1 (%, zero-shot, 2026.1 release, 566 problems)89.5
DeepResearchBench53.2Average Score87.5
Context Arena73.06Average Score (%)87
NVIDIA ComputeEval - cuBLAS96.3Pass@1 (%, zero-shot, 2026.1 release, 81 problems)86.8
NVIDIA ComputeEval - CCCL88.8Pass@1 (%, zero-shot, 2026.1 release, 80 problems)81.6
Chess Bench LLM1173Lichess Rating79.2

Interactive version: theaggregate.ai/model?slug=claude-opus-4-6-medium · How It Works · Data refreshed daily, snapshot 2026-09-19.