FlagEval EmbodiedVerse - VSI-Bench (tiny): leaderboard

Metric: Score. Source: flageval.baai.ac.cn. 24 models tracked.

Top models

#ModelScore
1GPT-557.53
2Qwen 3 VL 235B A22B (Thinking)54.74
3Gemini 2.5 Pro49.13
4Qwen 3 VL 235B A22B Instruct48.67
5Qwen 3 VL 30B A3B Instruct47.49
6Qwen 3 VL 30B A3B (Thinking)45.92
7GPT-4.145.36
8Claude Sonnet 4.545.28
9InternVL3-78B45.03
10Qwen 2.5 VL 32B Instruct39.13
11InternVL3-8B38.09
12O4 Mini33.47
13Qwen 2.5 VL 7B Instruct17.17
14Phi-4 Multimodal Instruct16.22
15Mistral Small 3.215.92

Interactive version: theaggregate.ai/benchmark?slug=flageval-embodiedverse-vsi-bench-tiny · How It Works · Data refreshed daily, snapshot 2026-09-05.