Claude Haiku 4.5 — benchmark results

Anthropic Haiku-tier Claude model for fast, cost-efficient tasks. Provider: Anthropic. Released 2025-10-01. Access: API.

Unified ELO 1627 ± 9, rank #418 of 1776 rated models, from 529 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
DABstep89.95Hard Level Accuracy (%)100
LiveSecBench91.43Overall Score (%)100
MT-JailBench18.24CrescendoX ASR (self-reported)100
RealityTest92.3Text disclosure probability (self-reported)100
SWE-PRBench15.3Overall (sbar) (self-reported)100
gwBenchmarks59.3Waveform (self-reported)100
DystopiaBench23.8Dystopian Compliance Score (0-100)97.7
Ko-AgentBench - L4 Parallel Tool Reasoning75Coverage (%)96.4
Bullshit Benchmark87.3BS Detection Rate (%)95.8
LLM-as-a-Reviewer99.7Low (NeurIPS 2022) (self-reported)95.5
AA-LCR70.3Score (self-reported)95.3
AGC-Bench - grapheval_ai_researcher1.06Dataset z-score93.8

Interactive version: theaggregate.ai/model?slug=claude-haiku-4-5 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.