OpenVLM MMT-Bench - Instance Captioning — leaderboard

Metric: Score (%). Source: huggingface.co. 207 models tracked.

Top models

#ModelScore
1InternVL3-8B95
2Qwen 2 VL 72B95
3Qwen 2 VL 7B95
4InternVL3-38B95
5Ovis2-8B95
6GPT-4.1 (2025-04-14)95
7Llama 3.2 90B Vision Instruct95
8InternVL3-78B90
9InternVL2-8B90
10InternVL3-14B90
11Claude 3.7 Sonnet90
12MiniCPM-V-2.685
13Grok 2 (1212)85
14Claude 3.5 Sonnet85
15GPT-4.1 Mini80

Interactive version: theaggregate.ai/benchmark?slug=openvlm-mmt-bench-instance-captioning · How the rankings work · Data refreshed daily, snapshot 2026-07-22.