FlagEval VQA - Text Understanding (Chinese): leaderboard

Metric: Score. Source: flageval.baai.ac.cn. 24 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro78.6
2GLM-4.5V75.3
3Gemini 2.5 Flash (Thinking)75.2
4Step-373
5Gemini 2.5 Flash71.4
6GPT-5 (High)66.2
7GPT-5 (Low)65.8
8GPT-4.164.1
9O4 Mini (Low)63.2
10O4 Mini (High)62.8
11O3 Mini (Low)59.4
12O3 Mini (High)59
13Claude Sonnet 4 (Thinking)56.2
14Mistral Medium 346.6
15Mistral Medium 3.140.6

Interactive version: theaggregate.ai/benchmark?slug=flageval-vqa-text-understanding-chinese · How It Works · Data refreshed daily, snapshot 2026-09-05.