INFACT (Factuality) - Clean Accuracy: leaderboard

Metric: Accuracy (0-1, shown times 100) on clean video (Mode I) for INFACT's factuality questions that need verifiable world knowledge (domain, procedural and physical knowledge, including shuffled instructional videos and physically implausible generated videos); zero-shot, default prompts, 16 uniformly sampled frames per video; higher is better. Source: arxiv.org. Saturation forecast: Around January 2027. 14 models tracked.

Top models

#ModelScoreOverall rank
1Gemini 3 Flash75.2#93
2GPT-5.167.8#131
3Qwen 3 VL 8B Instruct54.1#401
4Qwen 3 VL 32B Instruct52.1#276
5Qwen 2.5 VL 32B Instruct51.2#443
6Qwen 2.5 VL 7B Instruct50.3#643
7InternVL3-8B46.5#606

No result here: #3 Claude Opus 5.5, #5 GPT-6 Astra, #8 Claude Fable 5.1.

Interactive version: theaggregate.ai/benchmark?slug=infact-factuality-clean-accuracy · How It Works · Data refreshed daily, snapshot 2026-10-11.