KernelBench Hub - Hard: leaderboard

KernelBench Hard evaluates autonomous coding agents on GPU kernel engineering tasks, measuring correctness and speed relative to hardware baselines.

Metric: Best % of Hardware Roofline. Source: kernelbench.com. Status: years away from saturation. 9 models tracked.

Top models

#ModelScore
1Qwen 3.8 Max69.26
2GLM-5.363.19
3Grok 4.662.17
4GPT-5.6 Sol56.55
5DeepSeek V4 Flash (0731)48.6
6Kimi K348.55
7Claude Fable 543.03
8Claude Opus 537.08
9GLM-5.3 Flash10.21

Interactive version: theaggregate.ai/benchmark?slug=kernelbench-hub-hard · How It Works · Data refreshed daily, snapshot 2026-09-05.