FlagEval EmbodiedVerse - EmbSpatial-Bench: leaderboard

Metric: Score. Source: flageval.baai.ac.cn. 24 models tracked.

Top models

#ModelScore
1Qwen 3 VL 235B A22B (Thinking)83.49
2Qwen 3 VL 235B A22B Instruct82.66
3GPT-582.64
4Qwen 3 VL 30B A3B (Thinking)79.45
5Gemini 2.5 Pro78.68
6Qwen 3 VL 30B A3B Instruct76.29
7GPT-4.176.04
8InternVL3-78B74.59
9Qwen 2.5 VL 32B Instruct74.45
10InternVL3-8B71.98
11Qwen 2.5 VL 7B Instruct70.33
12Claude Sonnet 4.569.59
13Mistral Small 3.266.62
14O4 Mini55.71
15Phi-4 Multimodal Instruct39.53

Interactive version: theaggregate.ai/benchmark?slug=flageval-embodiedverse-embspatial-bench · How It Works · Data refreshed daily, snapshot 2026-09-05.