FlagEval VQA - Visual Puzzles: leaderboard

Metric: Score. Source: flageval.baai.ac.cn. 24 models tracked.

Top models

#ModelScore
1GPT-5 (High)44.7
2O4 Mini (High)40.9
3Gemini 2.5 Pro37.9
4O3 Mini (High)37.9
5O4 Mini (Low)37.1
6GPT-5 (Low)35.6
7O3 Mini (Low)32.6
8Step-329.5
9Gemini 2.5 Flash (Thinking)28
10Claude Sonnet 4 (Thinking)27.3
11GPT-4.126.5
12Gemini 2.5 Flash23.5
13Mistral Medium 3.115.9
14Mistral Medium 315.9
15GLM-4.5V15.9

Interactive version: theaggregate.ai/benchmark?slug=flageval-vqa-visual-puzzles · How It Works · Data refreshed daily, snapshot 2026-09-05.