GEB-Bench - Average (Vision Models): leaderboard

Metric: Macro-average accuracy over all eight tasks (%). Source: arxiv.org. 27 models tracked.

Top models

#ModelScore
1GPT-5.582.4
2Gemini 3.1 Pro (Preview)82.1
3GPT-5.276.9
4Kimi K2.576.9
5Gemma 4 31B72.1
6Claude Opus 4.869.8
7GLM-4.6V63
8Llama 4 Scout53.7
9Qwen 3 VL 4B46.5
10InternVL3-8B45.5
11Kimi-VL-A3B43.8
12Qwen 2 VL 7B36.2
13ERNIE 4.5 VL 28B A3B35.6
14Pixtral-12B34.2

Interactive version: theaggregate.ai/benchmark?slug=geb-bench-average-vision-models · How It Works · Data refreshed daily, snapshot 2026-09-19.