GEB-Bench - Scene-Story Matching: leaderboard

Metric: Accuracy (%; 4-way, chance 25%). Source: arxiv.org. 27 models tracked.

Top models

#ModelScore
1GPT-5.569
2Kimi K2.561.9
3Gemini 3.1 Pro (Preview)61.4
4GPT-5.258.6
5Claude Opus 4.842.4
6GLM-4.6V39
7Gemma 4 31B33.8
8Kimi-VL-A3B33.8
9ERNIE 4.5 VL 28B A3B32.4
10Llama 4 Scout31.9
11InternVL3-8B30.5
12Qwen 3 VL 4B29
13Pixtral-12B26.7
14Qwen 2 VL 7B22.9

Interactive version: theaggregate.ai/benchmark?slug=geb-bench-scene-story-matching · How It Works · Data refreshed daily, snapshot 2026-09-19.