LLaVA-Bench — leaderboard

LLaVA-Bench: Evaluates multimodal understanding across image, text, chart, diagram, or cross-modal reasoning tasks.

Metric: Score. Source: huggingface.co. Status: saturation imminent. 234 models tracked.

Top models

#ModelScore
1GPT-4.1 (2025-04-14)105.6
2Gemma 3 27B103.1
3InternVL3-78B100.4
4Grok 2 (1212)100
5GPT-4.1 Mini99.6
6Gemini 2.0 Flash97.7
7Gemini 1.5 Pro95.3
8InternVL3-38B94.7
9Claude 3.7 Sonnet94.4
10Gemma 3 12B93
11Gemma 3 4B92.5
12Claude 3.5 Sonnet (20241022)89.4
13GPT-4.1 Nano88.8
14Ovis2-8B87
15Llama 3.2 90B Vision Instruct86.5

Interactive version: theaggregate.ai/benchmark?slug=llava-bench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.