OpenVLM MMStar - Instance Reasoning — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 284 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro82.8
2GPT-5 (2025-08-07)79.6
3GPT-5 Nano78.8
4GPT-5 Mini (2025-08-07)78.4
5InternVL3-78B78
6InternVL3-38B75.2
7InternVL2.5-78B75.2
8InternVL3-8B74.8
9GPT-4.1 (2025-04-14)74.4
10Gemini 2.0 Flash74
11Qwen 2 VL 72B72.4
12Gemini 1.5 Pro (002)72.4
13InternVL3-14B72
14Claude 3.7 Sonnet72
15GPT-4o ChatGPT71.6

Interactive version: theaggregate.ai/benchmark?slug=openvlm-mmstar-instance-reasoning · How the rankings work · Data refreshed daily, snapshot 2026-07-22.