Claude Haiku 4.5: benchmark results

Anthropic Haiku-tier Claude model for fast, cost-efficient tasks. Provider: Anthropic. Released 2025-10-01. Access: API.

Unified ELO 1603 ± 1, rank #254 of 1392 rated models, from 596 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Boiling the Frog20.5Strict ASR (self-reported)100
DABstep89.95Hard Level Accuracy (%)100
DystopiaBench23.8Dystopian Compliance Score (0-100)100
LiveSecBench91.43Overall Score (%)100
MT-JailBench18.24CrescendoX ASR (self-reported)100
NRT-Bench8.7Aggregate ASR (self-reported)100
Nejumi 4 - ALT - Toxicity88.21Score (%)100
Phare - Average Safety83.16Score (%)100
RealityTest92.3Text disclosure probability (self-reported)100
SWE-PRBench15.3Overall (sbar) (self-reported)100
gwBenchmarks59.31Waveform (self-reported)100
RAI-Bench - RAG Robustness (LC Abstention)97Rate (%)99.3

Interactive version: theaggregate.ai/model?slug=claude-haiku-4-5 · How It Works · Data refreshed daily, snapshot 2026-09-05.