Claude 3.5 Haiku: benchmark results
Anthropic's fast, low-cost tier of the Claude 3.5 generation, launched text-only with a 200K context (October 2024). Provider: Anthropic. Released 2024-11-04. Access: API.
Unified ELO 1530 ± 1, rank #543 of 1392 rated models, from 150 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| LaborBench | 68.8 | F1 (self-reported) | 100 |
| LLM Public Goods Game | 40.97 | Avg. Contribution (%) | 94.7 |
| RAI-Bench - Refusal Rate (Career) | 100 | Rate (%) | 93.5 |
| Arabic IFEval | 70.9 | Arabic Accuracy (%) | 92.3 |
| Natural Language to Mongosh | 87.65 | NeXMaNeR (%) | 90.5 |
| MERA - SimpleAr | 99.9 | EM (%) | 88.7 |
| MERA - CheGeKa | 44.87 | F1 (%) | 87.6 |
| RAI-Bench - Refusal Rate (General) | 82 | Rate (%) | 85.3 |
| Bullshit Benchmark | 58.2 | BS Detection Rate (%) | 83 |
| MERA - BPS | 99.1 | Accuracy (%) | 80.5 |
| MERA - USE | 39.12 | Grade, normalized (%) | 80.4 |
| AMA-Bench - Open-World QA | 61.38 | Average Score (%) | 79.2 |
Interactive version: theaggregate.ai/model?slug=claude-3-5-haiku · How It Works · Data refreshed daily, snapshot 2026-09-05.