Video-MME-v2 - Level 1 Retrieval & Aggregation (w/o subs): leaderboard

Metric: Level 1 Score w/o sub (%). Source: video-mme-v2.netlify.app. 49 models tracked.

Top models

#ModelScore
1Gemini 3 Pro43.23
2Gemini 3 Flash41.48
3Doubao-Seed-2.0-Pro-26021541.32
4Kimi K2.541.05
5MiMo-V2-Omni38.67
6GPT-532.15
7Gemma 4 31B21.51
8Qwen 3 VL 235B A22B (Thinking)21.36
9Qwen 3.5 Omni Plus21.25
10Qwen 3 VL 235B A22B Instruct20.65
11Qwen 3 VL 8B (Thinking)16.97
12Qwen 3 VL 30B A3B (Thinking)16.94
13Qwen 3 VL 4B Instruct16.35
14Qwen 3 VL 8B Instruct15.37
15Qwen 2.5 VL 72B Instruct15.32

Interactive version: theaggregate.ai/benchmark?slug=video-mme-v2-level-1-retrieval-aggregation-w-o-subs · How It Works · Data refreshed daily, snapshot 2026-09-19.