OpenVLM MMT-Bench - Instance Captioning: leaderboard

Metric: Score (%). Source: huggingface.co. 207 models tracked.

Top models

#ModelScore
1InternVL3-8B95
2Qwen 2 VL 72B95
3Qwen 2 VL 7B95
4InternVL3-38B95
5GPT-4.1 (2025-04-14)95
6Llama 3.2 90B Vision Instruct95
7InternVL3-78B90
8InternVL2-8B90
9Claude 3.7 Sonnet90
10Claude 3.5 Sonnet85
11Grok 2 (1212)85
12GPT-4.1 Mini80
13Aquila-VL-2B80
14Pixtral-12B80
15Gemma 3 27B80

Interactive version: theaggregate.ai/benchmark?slug=openvlm-mmt-bench-instance-captioning · How It Works · Data refreshed daily, snapshot 2026-09-05.