GEB-Bench - Story-Theorem Matching: leaderboard

Metric: Accuracy (%; 4-way, chance 25%). Source: arxiv.org. 37 models tracked.

Top models

#ModelScore
1GPT-5.582.6
2Gemini 3.1 Pro (Preview)74.4
3Kimi K2.574.4
4GPT-5.273.6
5Claude Opus 4.873.6
6Gemma 4 31B68.6
7GLM-4.6V57.9
8DeepSeek V3.247.1
9Llama 4 Scout45.5
10Qwen 3 VL 4B41.3
11ERNIE 4.5 VL 28B A3B41.3
12InternVL3-8B38
13Kimi-VL-A3B33.1
14Qwen 2 VL 7B32.2
15Pixtral-12B28.1

Interactive version: theaggregate.ai/benchmark?slug=geb-bench-story-theorem-matching · How It Works · Data refreshed daily, snapshot 2026-09-19.