MultihopSpatial - 2-Hop Ego-Centric: leaderboard

Metric: Multiple-choice accuracy (%) on the 2-hop ego-centric questions of MultihopSpatial; higher is better. Source: arxiv.org. Saturation forecast: Around 2029. 37 models tracked.

Top models

#ModelScoreOverall rank
1GPT-5.2 (xHigh)49.7#105 (GPT-5.2)
2Gemini 3 Flash42.3#93
3Gemini 3 Pro36.8#77
4Claude Opus 4.5 (Thinking)35.2#79 (Claude Opus 4.5)
5Claude Opus 4.533.7#79
6Qwen 3 VL 235B A22B (Thinking)24.8#228 (Qwen 3 VL 235B A22B)
7Qwen 3 VL 32B (Thinking)24.3#287 (Qwen 3 VL 32B)
8GLM-4.6V (Non-reasoning)22.7#309 (GLM-4.6V)
9Gemma 3 4B (IT)22.5#971
10Qwen 3 VL 4B (Thinking)22.3#471 (Qwen 3 VL 4B)
11Gemma 3 12B (IT)22.1#655
12Claude Sonnet 4.5 (Thinking)22.1#138 (Claude Sonnet 4.5)
13Gemma 3 27B (IT)22#509
14Qwen 3 VL 32B Instruct21.9#276
15Qwen 3 VL 235B A22B Instruct21.9#264

No result here: #3 Claude Opus 5.5, #5 GPT-6 Astra, #8 Claude Fable 5.1.

Interactive version: theaggregate.ai/benchmark?slug=multihopspatial-2-hop-ego-centric · How It Works · Data refreshed daily, snapshot 2026-10-11.