See-or-Guess VQA - Subquestion-Guided: leaderboard

Metric: Subquestion-Guided variant (built from single-pass perceptual sub-questions): accuracy (%) with the image over 540 images from 21 public benchmarks in six reasoning categories; Qwen3-14B judges answer equivalence (yes/no), lenient extraction of answers after a missing </think> tag. Source: arxiv.org. Saturation forecast: Around July 2027. 11 models tracked.

Top models

#ModelScore
1Qwen 3.5 9B56.8
2Qwen 3.5 397B A17B54.6
3Gemini 2.5 Pro53.3
4GPT-5 Mini49.4
5Claude Sonnet 4.647.8
6Gemini 3.1 Flash Lite41.8
7InternVL3.5-8B28.9
8Phi-4 Multimodal Instruct22.6

Interactive version: theaggregate.ai/benchmark?slug=see-or-guess-vqa-subquestion-guided · How It Works · Data refreshed daily, snapshot 2026-09-29.