OpenVLM MMT-Bench: leaderboard

OpenCompass OpenVLM evaluation of MMT-Bench: multimodal tasks covering visual recognition, localization, OCR, counting, relation reasoning, visual math, and hallucination detection.

Metric: Accuracy (%). Source: huggingface.co. Status: saturated. 207 models tracked.

Top models

#ModelScore
1InternVL3-78B72.6
2InternVL3-38B71.9
3Qwen 2 VL 72B71.2
4GPT-4.1 (2025-04-14)71.1
5Grok 2 (1212)67.6
6InternVL3-8B64.9
7GPT-4.1 Mini63.4
8Qwen 2 VL 7B63.4
9Gemini 1.5 Pro63.4
10Gemini 1.5 Flash62.6
11Claude 3.5 Sonnet61.8
12Gemma 3 27B60.8
13Llama 3.2 90B Vision Instruct60.4
14Claude 3.7 Sonnet60.1
15InternVL2-8B59.8

Interactive version: theaggregate.ai/benchmark?slug=openvlm-mmt-bench · How It Works · Data refreshed daily, snapshot 2026-09-05.