FlagEval VQA - Subject Knowledge: leaderboard

Metric: Score. Source: flageval.baai.ac.cn. 24 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro77.7
2GPT-5 (Low)71.6
3GPT-5 (High)68.9
4Claude Sonnet 4 (Thinking)68.2
5Gemini 2.5 Flash (Thinking)67.6
6O3 Mini (High)65.5
7O4 Mini (High)64.2
8O3 Mini (Low)63.5
9Gemini 2.5 Flash61.5
10O4 Mini (Low)57.4
11Step-355.9
12GPT-4.149.3
13Mistral Medium 3.148
14GLM-4.5V47.3
15Mistral Medium 341.9

Interactive version: theaggregate.ai/benchmark?slug=flageval-vqa-subject-knowledge · How It Works · Data refreshed daily, snapshot 2026-09-05.