OpenVLM Q-Bench - Yes-or-No (Distortion): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 160 models tracked.

Top models

#ModelScore
1Qwen 2 VL 72B91
2Qwen 2 VL 7B89.4
3GPT-4.1 Mini88.8
4GPT-4.1 (2025-04-14)86.2
5InternVL3-78B85.6
6Qwen 2 VL 2B85.6
7Moonshot v1 8K85.1
8InternVL3-8B83.5
9Aquila-VL-2B82.4
10Gemini 1.5 Pro81.9
11GPT-4.1 Nano81.4
12InternVL3-14B81.4
13InternVL2-8B79.8
14Grok 2 (1212)79.8
15Pixtral-12B78.2

Interactive version: theaggregate.ai/benchmark?slug=openvlm-q-bench-yes-or-no-distortion · How It Works · Data refreshed daily, snapshot 2026-09-19.