OpenVLM Q-Bench - Yes-or-No (Others): leaderboard

Metric: Accuracy (%). Source: huggingface.co. 160 models tracked.

Top models

#ModelScore
1InternVL3-14B79.4
2Qwen 2 VL 72B78.9
3GPT-4.1 (2025-04-14)78.3
4InternVL3-8B78.3
5InternVL3-78B78.3
6Qwen 2 VL 7B77.7
7Moonshot v1 8K77.1
8GPT-4.1 Mini76.6
9Qwen 2 VL 2B76.6
10Pixtral-12B76
11InternVL2-8B74.3
12Gemini 1.5 Flash72.6
13Gemma 3 27B72
14Gemma 3 12B72
15GPT-4.1 Nano71.4

Interactive version: theaggregate.ai/benchmark?slug=openvlm-q-bench-yes-or-no-others · How It Works · Data refreshed daily, snapshot 2026-09-19.