OpenVLM Video - MMBench-Video - Temporal Reasoning: leaderboard

Metric: GPT-4 Rating (0-3). Source: huggingface.co. 45 models tracked.

Top models

#ModelScore
1GPT-4o (2024-08-06)1.97
2InternVL2.5-78B1.77
3Gemini 2.0 Flash1.67
4Gemini 1.5 Pro1.63
5Qwen 2 VL 72B1.52
6InternVL3-78B1.49
7InternVL3-8B1.43
8Gemini 1.5 Flash1.39
9Qwen 2 VL 7B1.21
10Claude 3.5 Sonnet1.04
11InternVL2-8B1
12Phi-4 Multimodal Instruct0.7

Interactive version: theaggregate.ai/benchmark?slug=openvlm-video-mmbench-video-temporal-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-19.