FlagEval VQA - Spatial Reasoning: leaderboard

Metric: Score. Source: flageval.baai.ac.cn. 24 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro42.1
2GPT-5 (High)42.1
3O3 Mini (High)39.3
4GLM-4.5V38.6
5O4 Mini (High)37.9
6O3 Mini (Low)37.9
7GPT-4.137.1
8Gemini 2.5 Flash36.4
9GPT-5 (Low)34.3
10Gemini 2.5 Flash (Thinking)32.9
11O4 Mini (Low)31.4
12Step-327.7
13Claude Sonnet 4 (Thinking)26.4
14Mistral Medium 325.7
15Mistral Medium 3.122.9

Interactive version: theaggregate.ai/benchmark?slug=flageval-vqa-spatial-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-05.