OpenVLM Video - MMBench-Video - Commonsense Reasoning: leaderboard

Metric: GPT-4 Rating (0-3). Source: huggingface.co. 45 models tracked.

Top models

#ModelScore
1GPT-4o (2024-08-06)1.94
2InternVL2.5-78B1.89
3Gemini 2.0 Flash1.78
4Gemini 1.5 Pro1.78
5InternVL3-78B1.75
6Gemini 1.5 Flash1.75
7Qwen 2 VL 72B1.73
8Claude 3.5 Sonnet1.54
9InternVL3-8B1.52
10Qwen 2 VL 7B1.28
11InternVL2-8B1.14
12Phi-4 Multimodal Instruct0.67

Interactive version: theaggregate.ai/benchmark?slug=openvlm-video-mmbench-video-commonsense-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-19.