FlagEval VQA - Text Understanding (English): leaderboard

Metric: Score. Source: flageval.baai.ac.cn. 24 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro81.5
2Gemini 2.5 Flash (Thinking)80.8
3Gemini 2.5 Flash77.1
4GPT-4.174.6
5GPT-5 (High)74.4
6GPT-5 (Low)73
7O3 Mini (High)72.4
8O3 Mini (Low)71.5
9GLM-4.5V67.5
10O4 Mini (High)65.3
11O4 Mini (Low)63.9
12Mistral Medium 360.6
13Mistral Medium 3.160.4
14Step-354.9
15Claude Sonnet 4 (Thinking)49.5

Interactive version: theaggregate.ai/benchmark?slug=flageval-vqa-text-understanding-english · How It Works · Data refreshed daily, snapshot 2026-09-05.