FlagEval EmbodiedVerse - MMSI-Bench: leaderboard

Metric: Score. Source: flageval.baai.ac.cn. 24 models tracked.

Top models

#ModelScore
1GPT-540.9
2Gemini 2.5 Pro39.2
3Qwen 3 VL 235B A22B Instruct33.8
4Claude Sonnet 4.532
5Qwen 3 VL 235B A22B (Thinking)31.2
6GPT-4.130.6
7Qwen 3 VL 30B A3B (Thinking)29.96
8Qwen 3 VL 30B A3B Instruct29.4
9O4 Mini29.2
10Qwen 2.5 VL 32B Instruct28.3
11Phi-4 Multimodal Instruct27.2
12Qwen 2.5 VL 7B Instruct27.2
13InternVL3-8B27.1
14InternVL3-78B26.7
15Mistral Small 3.226.4

Interactive version: theaggregate.ai/benchmark?slug=flageval-embodiedverse-mmsi-bench · How It Works · Data refreshed daily, snapshot 2026-09-05.