OpenVLM MMT-Bench — leaderboard

OpenCompass OpenVLM evaluation of MMT-Bench: multimodal tasks covering visual recognition, localization, OCR, counting, relation reasoning, visual math, and hallucination detection.

Metric: Accuracy (%). Source: huggingface.co. Status: saturation imminent. 207 models tracked.

Top models

#ModelScore
1InternVL3-78B72.6
2InternVL3-38B71.9
3Qwen 2 VL 72B71.2
4GPT-4.1 (2025-04-14)71.1
5InternVL3-14B69.7
6Grok 2 (1212)67.6
7Ovis2-8B66.6
8InternVL3-8B64.9
9GPT-4.1 Mini63.4
10Qwen 2 VL 7B63.4
11Gemini 1.5 Pro63.4
12Gemini 1.5 Flash62.6
13Claude 3.5 Sonnet61.8
14MiniCPM-V-2.660.8
15Gemma 3 27B60.8

Interactive version: theaggregate.ai/benchmark?slug=openvlm-mmt-bench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.