Video-MME-v2: leaderboard

Second-generation video understanding benchmark with 800 videos and non-linear consistency scoring across 3 difficulty levels. 8-option MCQ with grouped evaluation penalizing inconsistency.

Metric: Avg Accuracy w/o sub (%). Source: video-mme-v2.netlify.app. Status: saturation imminent. 49 models tracked.

Top models

#ModelScore
1Median Expert94.94
2Gemini 3 Pro56.8
3Doubao-Seed-2.0-Pro-26021553.1
4Gemini 3 Flash52.4
5Kimi K2.551.2
6MiMo-V2-Omni47.1
7GPT-544.7
8Qwen 3.5 Omni Plus38.2
9Qwen 3 VL 235B A22B (Thinking)36.8
10Gemma 4 31B36.7
11Qwen 3 VL 235B A22B Instruct33.8
12Qwen 3 VL 8B (Thinking)29.7
13Qwen 3 VL 30B A3B (Thinking)29.5
14Qwen 3 VL 8B Instruct27.9
15Qwen3 Omni 30B A3B Instruct27

Interactive version: theaggregate.ai/benchmark?slug=video-mme-v2 · How It Works · Data refreshed daily, snapshot 2026-09-05.