OpenVLM Q-Bench - What (In-context Others): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 160 models tracked.

Top models

#ModelScore
1GPT-4.1 Mini92.2
2GPT-4.1 Nano92.2
3Gemma 3 27B92.2
4GPT-4.1 (2025-04-14)91.1
5InternVL3-8B91.1
6Pixtral-12B91.1
7Gemini 1.5 Flash91.1
8Qwen 2 VL 72B90
9Gemma 3 12B90
10InternVL3-78B88.9
11Qwen 2 VL 7B88.9
12InternVL3-14B88.9
13Grok 2 (1212)88.9
14Gemini 1.5 Pro87.8
15Moonshot v1 8K86.7

Interactive version: theaggregate.ai/benchmark?slug=openvlm-q-bench-what-in-context-others · How It Works · Data refreshed daily, snapshot 2026-09-19.