Claude Opus 4.6 (Medium): benchmark results
Claude Opus 4.6 evaluated at the medium reasoning-effort setting. Provider: Anthropic. Released 2026-02-05. Access: API.
Unified ELO 1689 ± 1, rank #181 of 3078 rated models, from 18 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| BeQu - Experiment 1 - Entailment F1 | 47.2 | Entailment F1 (%) | 100 |
| MageBench S1 | 1747 | Rating | 100 |
| MageBench Season 1 | 1747 | Rating (self-reported) | 100 |
| BeQu - Experiment 1 - Entailment Recall | 39.2 | Entailment Recall (%) | 94.7 |
| NVIDIA ComputeEval - Math Libs | 91.1 | Pass@1 (%, zero-shot, 2026.1 release, 101 problems) | 94.7 |
| NVIDIA ComputeEval - cuDNN | 36.3 | Pass@1 (%, zero-shot, 2026.1 release, 113 problems) | 94.7 |
| NVIDIA ComputeEval | 68.6 | Pass@1 (%, zero-shot, 2026.1 release, 566 problems) | 89.5 |
| DeepResearchBench | 53.2 | Average Score | 87.5 |
| Context Arena | 73.06 | Average Score (%) | 87 |
| NVIDIA ComputeEval - cuBLAS | 96.3 | Pass@1 (%, zero-shot, 2026.1 release, 81 problems) | 86.8 |
| NVIDIA ComputeEval - CCCL | 88.8 | Pass@1 (%, zero-shot, 2026.1 release, 80 problems) | 81.6 |
| Chess Bench LLM | 1173 | Lichess Rating | 79.2 |
Interactive version: theaggregate.ai/model?slug=claude-opus-4-6-medium · How It Works · Data refreshed daily, snapshot 2026-09-19.