OpenVLM MMStar - Instance Reasoning: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 284 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro82.8
2GPT-579.6
3GPT-5 Nano78.8
4GPT-5 Mini (2025-08-07)78.4
5InternVL3-78B78
6InternVL3-38B75.2
7InternVL2.5-78B75.2
8InternVL3-8B74.8
9GPT-4.1 (2025-04-14)74.4
10Gemini 2.0 Flash74
11Qwen 2 VL 72B72.4
12Gemini 1.5 Pro (002)72.4
13Claude 3.7 Sonnet72
14GPT-4o ChatGPT71.6
15Gemini 1.5 Flash (002)70.8

Interactive version: theaggregate.ai/benchmark?slug=openvlm-mmstar-instance-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-05.