Claude Haiku 4.5 (Thinking): benchmark results
Claude Haiku 4.5 evaluated with thinking enabled. Provider: Anthropic. Released 2025-10-01. Access: API.
Unified ELO 1554 ± 1, rank #616 of 1761 rated models, from 66 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AA Omniscience - Software Engineering (SWE) - Julia | 24 | Accuracy (%) | 80.2 |
| AA AIME 2025 | 83.67 | Accuracy (%) | 79.8 |
| AA Omniscience - Software Engineering (SWE) - HTML | 42 | Accuracy (%) | 78.3 |
| AA Omniscience | -4.37 | Score | 77.3 |
| AA Long Context Reasoning | 74.33 | Accuracy (%) | 76.6 |
| AA-LCR | 73.67 | Accuracy (self-reported) | 75.4 |
| AA Omniscience - Software Engineering (SWE) - Rust | 56 | Accuracy (%) | 74.1 |
| AA Omniscience - Software Engineering (SWE) - C | 44 | Accuracy (%) | 73.4 |
| BenchTable | 61.3 | Total Score (%) | 72.7 |
| AA Omniscience - Software Engineering (SWE) - R | 16 | Accuracy (%) | 72.5 |
| AA Omniscience - Software Engineering (SWE) - Dart | 24 | Accuracy (%) | 72.2 |
| AA Omniscience - Software Engineering (SWE) - JavaScript | 34.55 | Accuracy (%) | 72 |
Interactive version: theaggregate.ai/model?slug=claude-haiku-4-5-thinking · How It Works · Data refreshed daily, snapshot 2026-09-05.