OpenVLM MTVQA: leaderboard

OpenCompass OpenVLM evaluation of MTVQA: multilingual text-centric visual question answering over images containing text in Arabic, German, French, Italian, Japanese, Korean, Russian, Thai, Vietnamese, and Chinese.

Metric: Accuracy (%). Source: huggingface.co. Status: saturated. 157 models tracked.

Top models

#ModelScore
1GPT-4.1 Mini36.8
2GPT-4.1 (2025-04-14)34.1
3InternVL3-78B32.5
4InternVL3-38B32.4
5Gemini 1.5 Pro32
6Claude 3.7 Sonnet30.6
7Gemini 1.5 Flash30.5
8InternVL3-8B30.4
9Qwen 2 VL 72B29.6
10Gemma 3 27B28.9
11GPT-4.1 Nano27.6
12Qwen 2 VL 7B25.8
13Gemma 3 12B23.8
14Grok 2 (1212)22.6
15Gemma 3 4B22.1

Interactive version: theaggregate.ai/benchmark?slug=openvlm-mtvqa · How It Works · Data refreshed daily, snapshot 2026-09-05.