Video-MME-v2 - Level 3 Complex Reasoning (w/o subs): leaderboard

Metric: Level 3 Score w/o sub (%). Source: video-mme-v2.netlify.app. 49 models tracked.

Top models

#ModelScore
1Gemini 3 Pro30.15
2Doubao-Seed-2.0-Pro-26021526.21
3Gemini 3 Flash24.95
4Kimi K2.524.8
5GPT-521.33
6MiMo-V2-Omni20.37
7Gemma 4 31B15.98
8Qwen 3.5 Omni Plus14.53
9Qwen 3 VL 235B A22B (Thinking)14.49
10Qwen 3 VL 235B A22B Instruct13.89
11Qwen 2.5 VL 72B Instruct12.61
12Qwen 3 VL 8B (Thinking)11.11
13Qwen 3 VL 8B Instruct10.72
14Qwen 3 VL 4B Instruct10.26
15Qwen 3 VL 30B A3B (Thinking)10.02

Interactive version: theaggregate.ai/benchmark?slug=video-mme-v2-level-3-complex-reasoning-w-o-subs · How It Works · Data refreshed daily, snapshot 2026-09-19.