Graphwalks BFS >128k: leaderboard

Long-context Graphwalks breadth-first-search task over 128k tokens, stressing graph traversal when the relevant edges are spread through a very large input.

Metric: Score (%). Source: llm-stats.com. Status: saturation imminent. 11 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol90.7
2GPT-5.6 Luna81.3
3Claude Mythos Preview80
4GPT-5.6 Terra76.9
5Claude Opus 4.868.1
6Claude Opus 4.661.5
7GPT-5.545.4
8GPT-5.421.4
9GPT-4.119
10GPT-4.1 Mini15
11GPT-4.1 Nano2.9

Interactive version: theaggregate.ai/benchmark?slug=graphwalks-bfs-over-128k · How It Works · Data refreshed daily, snapshot 2026-09-05.