ProLLM - Image Understanding — leaderboard

ProLLM benchmark measuring LLM image comprehension and caption quality across business contexts.

Metric: Score (%). Source: www.prollm.ai. Status: saturated. 27 models tracked.

Top models

#ModelScore
1O389.3
2O188.6
3GPT-4o87.9
4GPT-4.183.9
5GPT-4.583.2
6GPT-4.1 Mini81.2
7Gemini 2.5 Pro80.5
8O4 Mini75.8
9GPT-4o Mini73.2
10Gemini 2.0 Flash71.1
11Llama 4 Scout Instruct61.7
12Llama 4 Maverick Instruct58.4
13GPT-4.1 Nano57
14Pixtral Large55
15Qwen 2.5 VL 7B Instruct52.3

Interactive version: theaggregate.ai/benchmark?slug=prollm-image-understanding · How the rankings work · Data refreshed daily, snapshot 2026-07-22.