KernelBench-Verified - Level 3: leaderboard

Metric: Fast@1 (%; 50 full-architecture problems; share of problems whose fastest correct sample beats the baseline; single-turn KernelBench prompt, best of five samples; correctness gated on four hidden input distributions (original, x3, x0.01, negated); timing against a TF32-enabled eager PyTorch baseline on an H200). Source: arxiv.org. Saturation forecast: Around September 2028. 7 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)38
2GPT-5.532
3Claude Sonnet 4.630
4Claude Opus 4.728
5Gemini 3 Flash (Preview)26
6Claude Opus 4.824
7Kimi K2.624

Interactive version: theaggregate.ai/benchmark?slug=kernelbench-verified-level-3 · How It Works · Data refreshed daily, snapshot 2026-09-29.