OpenVLM MMT-Bench - Reasoning Segmentation — leaderboard

Metric: Score (%). Source: huggingface.co. 207 models tracked.

Top models

#ModelScore
1InternVL3-38B89.5
2InternVL3-14B84.2
3InternVL3-78B78.9
4Qwen 2 VL 72B78.9
5InternVL3-8B73.7
6Qwen 2 VL 7B73.7
7Grok 2 (1212)68.4
8Gemini 1.5 Pro63.2
9InternVL2-8B57.9
10Ovis2-8B57.9
11Aquila-VL-2B57.9
12Claude 3.7 Sonnet57.9
13GPT-4.1 Mini52.6
14Pixtral-12B52.6
15GPT-4.1 (2025-04-14)52.6

Interactive version: theaggregate.ai/benchmark?slug=openvlm-mmt-bench-reasoning-segmentation · How the rankings work · Data refreshed daily, snapshot 2026-07-22.