OpenVLM Q-Bench - How (In-context Others): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 160 models tracked.

Top models

#ModelScore
1InternVL3-78B82.4
2Qwen 2 VL 72B81.2
3InternVL3-14B81.2
4GPT-4.1 Mini80
5Gemma 3 12B80
6Moonshot v1 8K78.8
7GPT-4.1 (2025-04-14)77.6
8InternVL3-8B77.6
9Aquila-VL-2B77.6
10Pixtral-12B77.6
11Gemini 1.5 Flash77.6
12InternVL2-8B75.3
13Qwen 2 VL 2B75.3
14Gemma 3 27B75.3
15Gemini 1.5 Pro74.1

Interactive version: theaggregate.ai/benchmark?slug=openvlm-q-bench-how-in-context-others · How It Works · Data refreshed daily, snapshot 2026-09-19.