Graphwalks BFS <128k: leaderboard

Graphwalks breadth-first-search task below 128k context, testing graph traversal and reachable-node reasoning from serialized graph inputs.

Metric: Score (%). Source: llm-stats.com. Status: saturated. 11 models tracked.

Top models

#ModelScore
1GPT-5.294
2GPT-5.493
3GPT-578.3
4GPT-5.4 Mini76.3
5GPT-5.4 Nano73.4
6GPT-4.572.3
7GPT-4.1 Mini61.7
8GPT-4.161.7
9O3 Mini51
10GPT-4o41.7
11GPT-4.1 Nano25

Interactive version: theaggregate.ai/benchmark?slug=graphwalks-bfs-under-128k · How It Works · Data refreshed daily, snapshot 2026-09-05.