KernelBench Hard: leaderboard

Metric: Mean Peak Fraction Across Problems (ratio). Source: benchmarklist.com. 59 models tracked.

Top models

#ModelScore
1Claude Fable 5 (Max)0.35
2Qwen 3.8 Max (xHigh)0.34
3GLM-5.20.26
4GLM-5.30.25
5Claude Opus 4.80.24
6DeepSeek V4 Pro0.24
7Claude Opus 4.8 (Max)0.24
8Grok 4.6 (xHigh)0.24
9Claude Opus 5 (Max)0.23
10Kimi K30.23
11MiniMax-M30.22
12GPT-5.6 Sol (xHigh)0.22
13Claude Fable 50.22
14DeepSeek V4 Flash (0731)0.2
15LongCat 2.00.16

Interactive version: theaggregate.ai/benchmark?slug=kernelbench-hard · How It Works · Data refreshed daily, snapshot 2026-09-19.