Video-MME-v2 — leaderboard

Second-generation video understanding benchmark with 800 videos and non-linear consistency scoring across 3 difficulty levels. 8-option MCQ with grouped evaluation penalizing inconsistency.

Metric: Avg Accuracy w/o sub (%). Source: video-mme-v2.netlify.app. Status: saturation imminent. 49 models tracked.

Top models

#ModelScore
1Human Expert94.94
2Gemini 3 Pro56.8
3Gemini 3 Flash52.4
4Kimi K2.551.2
5MiMo-V2-Omni47.1
6GPT-544.7
7Qwen 3.5 Omni Plus38.2
8Qwen 3 VL 235B A22B (Thinking)36.8
9Gemma 4 31B36.7
10Qwen 3 VL 235B A22B Instruct33.8
11Qwen 3 VL 8B (Thinking)29.7
12Qwen 3 VL 30B A3B (Thinking)29.5
13Qwen 3 VL 8B Instruct27.9
14Qwen3 Omni 30B A3B Instruct27
15Qwen 3 VL 4B Instruct26.2

Interactive version: theaggregate.ai/benchmark?slug=video-mme-v2 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.