VERHallu - Causal QA: leaderboard

Metric: Accuracy (%; 497 seven-option questions on why an event happens, distractors from language and vision-language priors; random 14.3; each model's own frame sampling and default settings, answer given as the option number). Source: arxiv.org. Saturation forecast: Around April 2027. 18 models tracked.

Top models

#ModelScore
1Gemini 3 Pro65.7
2Qwen 2.5 VL 7B Instruct40.8
3Qwen 2.5 VL 32B Instruct39.6
4InternVL3-8B35.4
5MiniCPM-V-2.632.9
6Qwen 2.5 VL 72B Instruct28.9

Interactive version: theaggregate.ai/benchmark?slug=verhallu-causal-qa · How It Works · Data refreshed daily, snapshot 2026-09-26.