OpenVLM Q-Bench - What (In-context Distortion): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 160 models tracked.

Top models

#ModelScore
1GPT-4.1 Mini92
2GPT-4.1 (2025-04-14)92
3InternVL3-78B91
4Qwen 2 VL 72B87
5Moonshot v1 8K86
6InternVL3-14B85
7GPT-4.1 Nano80
8InternVL3-8B79
9Qwen 2 VL 7B79
10Aquila-VL-2B78
11Grok 2 (1212)77
12Pixtral-12B76
13Qwen 2 VL 2B75
14Gemini 1.5 Flash75
15Gemma 3 27B74

Interactive version: theaggregate.ai/benchmark?slug=openvlm-q-bench-what-in-context-distortion · How It Works · Data refreshed daily, snapshot 2026-09-19.