OpenVLM Video - Video-MME (w/o subs) - Action Recognition: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 37 models tracked.

Top models

#ModelScore
1InternVL3-78B72.2
2InternVL2.5-78B70.3
3Gemini 2.0 Flash70
4GPT-4o (2024-08-06)66.8
5Qwen 2 VL 72B65.5
6InternVL3-8B62.6
7Qwen 2 VL 7B60.4
8Gemini 1.5 Flash59.4
9InternVL2-8B48.9
10Claude 3.5 Sonnet48.6
11Phi-4 Multimodal Instruct40.9

Interactive version: theaggregate.ai/benchmark?slug=openvlm-video-video-mme-w-o-subs-action-recognition · How It Works · Data refreshed daily, snapshot 2026-09-19.