CLEM TextMapWorld GraphReasoning — leaderboard

Metric: Game Clemscore (%). Source: huggingface.co. 27 models tracked.

Top models

#ModelScore
1Kimi K2 (Thinking)84.28
2Gemini 3 Flash83.08
3Claude Sonnet 4.582.82
4Claude Sonnet 4.5 (High)82.74
5Qwen 3 Max82.32
6Kimi K2.5 (Non-reasoning)73.16
7GLM-5 (Non-reasoning)71.99
8GLM-4.769.95
9GPT-5.268.61
10DeepSeek V3.268.47
11MiniMax-M2.567.25
12Qwen 2.5 Coder 32B Instruct63.24
13DeepSeek V3.2 (Non-reasoning)61.18
14Qwen 2.5 72B Instruct61.04
15Qwen 3 Next 80B A3B Instruct60.58

Interactive version: theaggregate.ai/benchmark?slug=clem-textmapworld-graphreasoning · How the rankings work · Data refreshed daily, snapshot 2026-07-22.