FlagEval VQA - Geographic Reasoning: leaderboard

Metric: Score. Source: flageval.baai.ac.cn. 24 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro70.2
2GPT-5 (Low)70.2
3GPT-5 (High)69
4O3 Mini (High)67.5
5O3 Mini (Low)66.5
6GPT-4.160.8
7Step-358.2
8Gemini 2.5 Flash (Thinking)58
9Gemini 2.5 Flash54.3
10O4 Mini (High)54
11O4 Mini (Low)47.7
12GLM-4.5V39.8
13Mistral Medium 330.1
14Mistral Medium 3.128.4
15Claude Sonnet 4 (Thinking)27.6

Interactive version: theaggregate.ai/benchmark?slug=flageval-vqa-geographic-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-05.