FlagEval VQA - Multi-Image Analysis: leaderboard

Metric: Score. Source: flageval.baai.ac.cn. 24 models tracked.

Top models

#ModelScore
1GPT-5 (High)62.5
2O3 Mini (Low)61.7
3O3 Mini (High)60
4GPT-5 (Low)58.3
5GPT-4.157.5
6Gemini 2.5 Pro51.7
7O4 Mini (High)51.7
8Gemini 2.5 Flash46.7
9GLM-4.5V45
10Gemini 2.5 Flash (Thinking)44.2
11O4 Mini (Low)43.3
12Step-342.5
13Claude Sonnet 4 (Thinking)33.3
14Mistral Medium 325
15Mistral Medium 3.120

Interactive version: theaggregate.ai/benchmark?slug=flageval-vqa-multi-image-analysis · How It Works · Data refreshed daily, snapshot 2026-09-05.