OpenVLM MMT-Bench - Multiple Instance Captioning: leaderboard

Metric: Score (%). Source: huggingface.co. 207 models tracked.

Top models

#ModelScore
1Claude 3.7 Sonnet100
2InternVL3-78B95
3InternVL3-8B95
4Qwen 2 VL 72B95
5Qwen 2 VL 7B95
6InternVL3-38B95
7Pixtral-12B95
8Gemma 3 27B95
9Gemini 1.5 Pro95
10Claude 3.5 Sonnet95
11Grok 2 (1212)95
12Gemini 1.5 Flash95
13GPT-4.1 (2025-04-14)95
14Llama 3.2 90B Vision Instruct95
15Aquila-VL-2B90

Interactive version: theaggregate.ai/benchmark?slug=openvlm-mmt-bench-multiple-instance-captioning · How It Works · Data refreshed daily, snapshot 2026-09-05.