FlagEval VQA - Scene Understanding: leaderboard

Metric: Score. Source: flageval.baai.ac.cn. 24 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro82.5
2GPT-5 (High)82.5
3GPT-5 (Low)80
4O4 Mini (High)77.5
5O3 Mini (High)77.5
6O3 Mini (Low)76.7
7O4 Mini (Low)75.8
8GPT-4.167.5
9Gemini 2.5 Flash (Thinking)66.7
10Claude Sonnet 4 (Thinking)54.2
11Step-353.8
12Gemini 2.5 Flash50
13GLM-4.5V29.2
14Mistral Medium 3.127.5
15Mistral Medium 322.5

Interactive version: theaggregate.ai/benchmark?slug=flageval-vqa-scene-understanding · How It Works · Data refreshed daily, snapshot 2026-09-05.