Claude Opus 4.1: benchmark results
Anthropic Opus-tier Claude model, an incremental Opus 4 upgrade focused on coding and agentic tasks. Provider: Anthropic. Released 2025-08-05. Access: API.
Unified ELO 1657 ± 1, rank #114 of 1392 rated models, from 144 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| FutureSearch DRB - Find Dataset | 0.71 | Average Score | 100 |
| Nejumi 4 - ALT - Truthfulness | 88.5 | Score (%) | 100 |
| PCB-Bench - Placement Macro CQ | 93.3 | Accuracy (%) | 100 |
| PCB-Bench - Placement Micro CQ | 94.35 | Accuracy (%) | 100 |
| PCB-Bench - Routing Micro CQ | 92.32 | Accuracy (%) | 100 |
| PCB-Bench - Routing Micro QA SBERT | 57.38 | SBERT similarity (%) | 100 |
| Nejumi 4 - ALT - Toxicity | 87.79 | Score (%) | 99.2 |
| Phare - Jailbreak Resistance | 81.35 | Score (%) | 98.5 |
| BenchTable | 81.9 | Total Score (%) | 98.3 |
| Nejumi 4 - GLP - Function Calling | 71.42 | Score (%) | 97.5 |
| SciArena | 1126.4 | Elo Rating | 97.3 |
| PCB-Bench - Routing Macro CQ | 99.16 | Accuracy (%) | 95.8 |
Interactive version: theaggregate.ai/model?slug=claude-opus-4-1 · How It Works · Data refreshed daily, snapshot 2026-09-05.