HalluHard: A Hard Multi-Turn Hallucination Benchmark: leaderboard

Metric: Avg (↓) (%). Source: benchmarklist.com. 17 models tracked.

Top models

#ModelScore
1Claude Opus 4.530.2
2GPT-5.2 (Thinking)38.2
3GPT-5.258.8
4Gemini 3 Pro61.9
5GPT-5 (Thinking)64.8
6Claude Sonnet 4.565.6
7Gemini 3 Flash69.5
8GPT-571.8
9DeepSeek V3 Chat75.8
10GPT-5 Mini75.9
11DeepSeek Reasoner76.8
12GLM-4.7 (Thinking)77.1
13Claude Haiku 4.579.5
14Kimi K2 (Thinking)80.1
15GPT-5 Nano85.1

Interactive version: theaggregate.ai/benchmark?slug=halluhard-a-hard-multi-turn-hallucination-benchmark · How It Works · Data refreshed daily, snapshot 2026-09-19.