OpenVLM Q-Bench - How (In-context Distortion): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 160 models tracked.

Top models

#ModelScore
1GPT-4.1 (2025-04-14)75.9
2Qwen 2 VL 72B71.3
3InternVL3-78B70.1
4GPT-4.1 Mini69
5Gemini 1.5 Pro69
6Qwen 2 VL 7B66.7
7Grok 2 (1212)66.7
8Aquila-VL-2B65.5
9Pixtral-12B65.5
10Qwen 2 VL 2B64.4
11InternVL3-8B63.2
12Gemini 1.5 Flash63.2
13Gemma 3 27B62.1
14GPT-4.1 Nano60.9
15InternVL3-14B60.9

Interactive version: theaggregate.ai/benchmark?slug=openvlm-q-bench-how-in-context-distortion · How It Works · Data refreshed daily, snapshot 2026-09-19.