FlagEval VQA - Overall: leaderboard

Metric: Score. Source: flageval.baai.ac.cn. 24 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro62.93
2GPT-5 (High)60.94
3GPT-5 (Low)59.11
4O3 Mini (High)57.17
5O3 Mini (Low)56.58
6O4 Mini (High)53.15
7Gemini 2.5 Flash (Thinking)53.13
8GPT-4.152.26
9O4 Mini (Low)49.39
10Gemini 2.5 Flash48.75
11Step-343.57
12Claude Sonnet 4 (Thinking)40.14
13GLM-4.5V37.92
14Mistral Medium 3.128.61
15Mistral Medium 328.61

Interactive version: theaggregate.ai/benchmark?slug=flageval-vqa-overall · How It Works · Data refreshed daily, snapshot 2026-09-05.