GEB-Bench - Story Identification: leaderboard

Metric: Accuracy (%; 25-way, chance 4%). Source: arxiv.org. 37 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)92.6
2GPT-5.590.1
3Kimi K2.584.3
4GPT-5.283.5
5Gemma 4 31B82.6
6Claude Opus 4.875.2
7DeepSeek V3.260.3
8GLM-4.6V52.9
9Llama 4 Scout33.9
10Qwen 3 VL 4B33.1
11Pixtral-12B28.9
12InternVL3-8B28.1
13Kimi-VL-A3B22.3
14Qwen 2 VL 7B19
15ERNIE 4.5 VL 28B A3B14

Interactive version: theaggregate.ai/benchmark?slug=geb-bench-story-identification · How It Works · Data refreshed daily, snapshot 2026-09-19.