Maze-Bench: leaderboard

Metric: Mean Score. Source: huggingface.co. 33 models tracked.

Top models

#ModelScore
1GPT-6 (Medium)94.99
2Claude Fable 5.1 (Medium)55.35
3Claude Opus 5 (Medium)50.86
4Kimi K3 (High)48.14
5Gemini 3.8 Flash (Medium)40.67
6Claude Fable 5 (Medium)39.35
7Kimi K3 (Max)32.89
8GPT-5.6 Sol (Medium)31.46
9Claude Opus 4.8 (Medium)29.88
10Gemini 3.5 Flash (Medium)26.45
11Claude Sonnet 5 (Medium)25.35
12Gemini 3.6 Flash (Medium)25.12
13Gemini 3.7 Flash (Medium)23.13
14GLM-5.3 Flash (High)22.18
15GPT-5.6 Luna (Medium)20.59

Interactive version: theaggregate.ai/benchmark?slug=maze-bench · How It Works · Data refreshed daily, snapshot 2026-09-19.