OpenVLM Q-Bench - Yes-or-No (In-context Others): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 160 models tracked.

Top models

#ModelScore
1Aquila-VL-2B91.4
2GPT-4.1 Mini90
3InternVL3-14B90
4Moonshot v1 8K90
5GPT-4.1 (2025-04-14)88.6
6Qwen 2 VL 72B88.6
7Qwen 2 VL 2B88.6
8Pixtral-12B88.6
9GPT-4.1 Nano87.1
10InternVL3-78B87.1
11Qwen 2 VL 7B87.1
12InternVL2-8B87.1
13InternVL3-8B85.7
14Gemini 1.5 Pro85.7
15Gemma 3 12B85.7

Interactive version: theaggregate.ai/benchmark?slug=openvlm-q-bench-yes-or-no-in-context-others · How It Works · Data refreshed daily, snapshot 2026-09-19.