OpenVLM MMT-Bench - LVLM Response Judgement — leaderboard

Metric: Score (%). Source: huggingface.co. 207 models tracked.

Top models

#ModelScore
1GPT-4.1 (2025-04-14)70
2InternVL3-78B65
3InternVL2-8B65
4Qwen 2 VL 72B60
5InternVL3-14B60
6GPT-4.1 Nano60
7Grok 2 (1212)60
8Gemini 1.5 Pro60
9Gemma 3 4B60
10Llama 3.2 90B Vision Instruct60
11GPT-4.1 Mini55
12Ovis2-8B55
13Aquila-VL-2B55
14MiniCPM-V-2.655
15Pixtral-12B55

Interactive version: theaggregate.ai/benchmark?slug=openvlm-mmt-bench-lvlm-response-judgement · How the rankings work · Data refreshed daily, snapshot 2026-07-22.