HallusionBench — leaderboard

HallusionBench evaluates multimodal large language models on visual illusion and hallucination-style image-text reasoning cases.

Metric: Overall Score. Source: huggingface.co. Status: saturation imminent. 284 models tracked.

Top models

#ModelScore
1GPT-5 (2025-08-07)65.2
2Gemini 2.5 Pro64.1
3GPT-5 Mini (2025-08-07)62.5
4GPT-5 Nano60.9
5GPT-4.560
6InternVL3-78B59.1
7Qwen 2 VL 72B58.7
8GPT-4.1 (2025-04-14)58.5
9Doubao-1.5-Pro58.5
10InternVL3-38B58.4
11Gemini 2.0 Flash58
12InternVL2.5-78B57.4
13GPT-4o ChatGPT57
14Ovis2-8B56.3
15InternVL3-14B55.9

Interactive version: theaggregate.ai/benchmark?slug=hallusionbench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.