FlagEval VQA - Long-tail Recognition: leaderboard

Metric: Score. Source: flageval.baai.ac.cn. 24 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro59.1
2GPT-4.154.2
3GPT-5 (Low)52.3
4O3 Mini (Low)52.3
5GPT-5 (High)48.9
6O3 Mini (High)48.5
7Gemini 2.5 Flash (Thinking)45.8
8O4 Mini (Low)40.2
9Gemini 2.5 Flash39.4
10O4 Mini (High)39.4
11Step-335
12Claude Sonnet 4 (Thinking)22.7
13GLM-4.5V18.2
14Mistral Medium 3.116.7
15Mistral Medium 315.9

Interactive version: theaggregate.ai/benchmark?slug=flageval-vqa-long-tail-recognition · How It Works · Data refreshed daily, snapshot 2026-09-05.