OpenVLM MME - Commonsense Reasoning: leaderboard

Metric: Score. Source: huggingface.co. 235 models tracked.

Top models

#ModelScore
1Qwen 2 VL 72B178.6
2InternVL3-78B175.7
3InternVL2.5-78B174.3
4InternVL3-38B172.1
5GPT-4.1 (2025-04-14)166.4
6GPT-4.1 Mini165.7
7Gemini 2.0 Flash160
8Claude 3.7 Sonnet157.1
9Grok 2 (1212)156.4
10Gemma 3 27B155
11Qwen 2 VL 7B152.1
12Claude 3.5 Sonnet (20241022)152.1
13Gemini 1.5 Pro150.7
14Gemini 1.0 Pro150
15InternVL3-8B148.6

Interactive version: theaggregate.ai/benchmark?slug=openvlm-mme-commonsense-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-05.