OmniMapBench - Single-Step Reasoning: leaderboard

Metric: Level 2 (single-step reasoning, 802 questions): strict exact-match accuracy on manually annotated single-choice, multiple-choice and ordering questions over map documents, chain-of-thought prompting (%); higher is better. Source: arxiv.org. Saturation forecast: Around December 2026. 25 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)81.53
2Qwen 3.5 397B A17B79.01
3Qwen 3.5 Plus77.64
4Qwen 3.5 27B77.1
5Qwen 3.5 122B A10B76.52
6Kimi K2.574.8
7Qwen 3.5 Flash73.87
8Qwen 3.5 35B A3B72.27
9Gemini 2.5 Pro70.7
10GPT-5 Mini62.59
11GPT-561.47
12Gemma 4 31B (IT)58.35
13GLM-4.5V54.24
14Claude Sonnet 4.552.63
15Gemma 4 26B A4B (IT)49.75

Interactive version: theaggregate.ai/benchmark?slug=omnimapbench-single-step-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-29.