OpenVLM MMT-Bench - Reasoning Segmentation: leaderboard

Metric: Score (%). Source: huggingface.co. 207 models tracked.

Top models

#ModelScore
1InternVL3-38B89.5
2InternVL3-78B78.9
3Qwen 2 VL 72B78.9
4InternVL3-8B73.7
5Qwen 2 VL 7B73.7
6Grok 2 (1212)68.4
7Gemini 1.5 Pro63.2
8InternVL2-8B57.9
9Aquila-VL-2B57.9
10Claude 3.7 Sonnet57.9
11GPT-4.1 Mini52.6
12Pixtral-12B52.6
13GPT-4.1 (2025-04-14)52.6
14GPT-4.1 Nano47.4
15Llama 3.2 11B Instruct47.4

Interactive version: theaggregate.ai/benchmark?slug=openvlm-mmt-bench-reasoning-segmentation · How It Works · Data refreshed daily, snapshot 2026-09-05.