KernelGenBench-MC (AutoKernel) - Platform B: leaderboard
Metric: Clean pass rate (%; share of the 110 PyTorch ATen operators whose generated Triton kernel passes numerical validation on every test case of its combinatorial shape, dtype and layout suite and every anti-hack check, as a drop-in replacement; the kernel-specialized AutoKernel agent with execution feedback; de-identified Platform B; 30-minute budget per operator). Source: arxiv.org. Saturation forecast: Rough model projection: around 2026. 3 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | AutoKernel + Qwen3.5-27B | 74 |
| 2 | AutoKernel + MiniMax-M2.5 | 71 |
| 3 | AutoKernel + GLM-5 | 59 |
Interactive version: theaggregate.ai/benchmark?slug=kernelgenbench-mc-autokernel-platform-b · How It Works · Data refreshed daily, snapshot 2026-09-29.