OpenVLM Video - Video-MME (w/o subs) - Spatial Reasoning: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 37 models tracked.

Top models

#ModelScore
1GPT-4o (2024-08-06)89.3
2Qwen 2 VL 72B85.7
3InternVL3-78B83.9
4InternVL2.5-78B83.9
5InternVL3-8B82.1
6Gemini 2.0 Flash80.4
7Qwen 2 VL 7B80.4
8Gemini 1.5 Flash80.4
9InternVL2-8B73.2
10Claude 3.5 Sonnet69.6
11Phi-4 Multimodal Instruct48.2

Interactive version: theaggregate.ai/benchmark?slug=openvlm-video-video-mme-w-o-subs-spatial-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-19.