OpenVLM MMT-Bench - Multiple Instance Captioning — leaderboard

Metric: Score (%). Source: huggingface.co. 207 models tracked.

Top models

#ModelScore
1Claude 3.7 Sonnet100
2InternVL3-78B95
3InternVL3-8B95
4Qwen 2 VL 72B95
5Qwen 2 VL 7B95
6InternVL3-38B95
7Pixtral-12B95
8Gemma 3 27B95
9Grok 2 (1212)95
10Gemini 1.5 Pro95
11Claude 3.5 Sonnet95
12Gemini 1.5 Flash95
13GPT-4.1 (2025-04-14)95
14Llama 3.2 90B Vision Instruct95
15InternVL3-14B90

Interactive version: theaggregate.ai/benchmark?slug=openvlm-mmt-bench-multiple-instance-captioning · How the rankings work · Data refreshed daily, snapshot 2026-07-22.