VEBench: leaderboard

Metric: Overall score (%): mean of Technique Recognition accuracy and Footage Selection accuracy with subtitles; higher is better. Source: arxiv.org. Saturation forecast: Around 2028. 9 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro39.55
2Qwen 3 VL 32B Instruct34.36
3GPT-4o33.29
4Qwen 3 VL 8B Instruct32.39
5Qwen 3 VL 4B Instruct30.2
6InternVL3-14B29.12
7Qwen 3 VL 30B A3B Instruct28.84
8Qwen 2.5 VL 7B Instruct28.74
9InternVL3-8B27.99

Interactive version: theaggregate.ai/benchmark?slug=vebench · How It Works · Data refreshed daily, snapshot 2026-10-07.