GapEval - Reasoning (Understanding): leaderboard

Metric: Accuracy (%; image selection, knowledge selection, real-world and logical reasoning problems; text answers to GapEval's bidirectional questions, judged correct or incorrect by GPT-5-mini against reference answers, mean of ten sampled runs). Source: arxiv.org. Saturation forecast: Around December 2026. 15 models tracked.

Top models

#ModelScore
1Gemini 2.5 Flash77.05
2GPT-574.74
3GPT-5 Mini73.8
4Qwen 3 VL 235B A22B60.2
5Qwen 3 VL 8B53.38

Interactive version: theaggregate.ai/benchmark?slug=gapeval-reasoning-understanding · How It Works · Data refreshed daily, snapshot 2026-09-26.