VERHallu - Subevent QA: leaderboard

Metric: Accuracy (%; 258 seven-option questions on which event occurred during a main event, distractors from language and vision-language priors; random 14.3; each model's own frame sampling and default settings, answer given as the option number). Source: arxiv.org. Saturation forecast: Around 2033. 18 models tracked.

Top models

#ModelScore
1Qwen 2.5 VL 7B Instruct40.7
2Gemini 3 Pro40
3InternVL3-8B36.4
4Qwen 2.5 VL 72B Instruct34.8
5MiniCPM-V-2.633.3
6Qwen 2.5 VL 32B Instruct31.4

Interactive version: theaggregate.ai/benchmark?slug=verhallu-subevent-qa · How It Works · Data refreshed daily, snapshot 2026-09-26.