LLM-WikiRace — leaderboard

Planning benchmark where models navigate Wikipedia hyperlink graphs from a start page to a target page, testing strategy over real-world knowledge graphs.

Metric: Average Success (%). Source: llmwikirace.github.io. Status: saturation imminent. 29 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)64.93
2GPT-555.83
3Claude Opus 4.555.17
4Claude Opus 4.654.57
5DeepSeek R154.23
6Gemini 2.5 Flash51.4
7GPT-5.250.23
8GPT-5 Mini47.5
9Claude Sonnet 4.547.3
10Kimi K246.6
11Grok 4.1 Fast46.57
12Gemini 2.0 Flash45.1
13Llama 3 70B43.6
14Gemma 3 27B36.67
15GPT-5 Nano33.4

Interactive version: theaggregate.ai/benchmark?slug=llm-wikirace · How the rankings work · Data refreshed daily, snapshot 2026-07-22.