OpenVLM MME - Commonsense Reasoning — leaderboard

Metric: Score. Source: huggingface.co. 235 models tracked.

Top models

#ModelScore
1Qwen 2 VL 72B178.6
2InternVL3-78B175.7
3InternVL2.5-78B174.3
4InternVL3-38B172.1
5GPT-4.1 (2025-04-14)166.4
6GPT-4.1 Mini165.7
7InternVL3-14B165.7
8Gemini 2.0 Flash160
9Ovis2-8B158.6
10Claude 3.7 Sonnet157.1
11Grok 2 (1212)156.4
12Gemma 3 27B155
13Qwen 2 VL 7B152.1
14Claude 3.5 Sonnet (20241022)152.1
15Gemini 1.5 Pro150.7

Interactive version: theaggregate.ai/benchmark?slug=openvlm-mme-commonsense-reasoning · How the rankings work · Data refreshed daily, snapshot 2026-07-22.