OpenVLM SEED-Bench 2 — leaderboard

OpenCompass OpenVLM evaluation of SEED-Bench 2: a hierarchical multimodal benchmark testing image, video, and interleaved image-text understanding across 27 dimensions.

Metric: Accuracy (%). Source: huggingface.co. Status: saturated. 59 models tracked.

Top models

#ModelScore
1GPT-4.1 (2025-04-14)76
2GPT-4.1 Mini75
3Gemini 1.5 Flash70.2
4InternVL3-14B67.7
5InternVL3-8B67.1
6GPT-4.1 Nano64.4
7Gemma 3 27B59.9
8Pixtral-12B57.9
9Gemma 3 12B57.6
10Gemma 3 4B52.7
11Aquila-VL-2B49.3

Interactive version: theaggregate.ai/benchmark?slug=openvlm-seed-bench-2 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.