MMVet: leaderboard

218 open-ended questions over 200 images on recognition, OCR, knowledge, language generation, spatial awareness and math in 16 combinations, from NUS and Microsoft (2023); GPT-4 scores each answer.

Metric: Score. Source: huggingface.co. 284 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro83.3
2InternVL3-8B82.8
3InternVL3-38B81.1
4InternVL3-78B80.7
5Doubao-1.5-Pro79.8
6GPT-4.1 (2025-04-14)78.8
7GPT-577.6
8GPT-4o ChatGPT76.9
9GPT-4.575.3
10Gemini 1.5 Pro (002)74.6
11GPT-5 Mini (2025-08-07)74.6
12GPT-4.1 Mini74.3
13Qwen 2 VL 72B73.9
14Gemini 2.0 Flash73.6
15Gemma 3 27B71

Interactive version: theaggregate.ai/benchmark?slug=mmvet · How It Works · Data refreshed daily, snapshot 2026-09-05.