NVIDIA ComputeEval - cuda-runtime: leaderboard

Metric: Pass@1 (%, zero-shot, 2026.1 release, 29 problems). Source: huggingface.co. 20 models tracked.

Top models

#ModelScore
1GPT-5.4 (High)96.6
2Kimi K2.5 (Thinking)93.1
3Claude Opus 4.6 (High)93.1
4Claude Sonnet 4.6 (High)93.1
5GLM-5 (Thinking)89.7
6Claude Sonnet 4.6 (Medium)89.7
7Claude Opus 4.6 (Medium)89.7
8GPT-5 Mini (High)86.2
9GPT-5.4 (Medium)86.2
10Gemini 3.1 Flash Lite (Medium)86.2
11Gemini 3.1 Flash Lite (High)82.8
12GPT-5 Mini (Medium)79.3
13GPT-OSS-120B (High)75.9
14GPT-OSS-120B (Medium)72.4
15GPT-OSS-20B (High)69

Interactive version: theaggregate.ai/benchmark?slug=nvidia-computeeval-cuda-runtime · How It Works · Data refreshed daily, snapshot 2026-09-19.