OpenVLM Q-Bench - Yes-or-No (In-context Distortion): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 160 models tracked.

Top models

#ModelScore
1GPT-4.1 (2025-04-14)82.1
2Qwen 2 VL 72B82.1
3Moonshot v1 8K80.3
4GPT-4.1 Mini79.5
5Gemini 1.5 Pro77.8
6InternVL3-14B76.1
7Gemini 1.5 Flash76.1
8GPT-4.1 Nano75.2
9Qwen 2 VL 7B75.2
10Qwen 2 VL 2B75.2
11InternVL3-78B74.4
12InternVL3-8B71.8
13Gemma 3 12B71.8
14Aquila-VL-2B70.1
15Gemma 3 27B69.2

Interactive version: theaggregate.ai/benchmark?slug=openvlm-q-bench-yes-or-no-in-context-distortion · How It Works · Data refreshed daily, snapshot 2026-09-19.