NVIDIA ComputeEval - Math Libs: leaderboard

Metric: Pass@1 (%, zero-shot, 2026.1 release, 101 problems). Source: huggingface.co. 20 models tracked.

Top models

#ModelScore
1Claude Opus 4.6 (High)91.1
2Claude Sonnet 4.6 (High)91.1
3Claude Opus 4.6 (Medium)91.1
4Claude Sonnet 4.6 (Medium)89.1
5GPT-5.4 (High)82.2
6GPT-5.4 (Medium)82.2
7GPT-OSS-120B (High)57.4
8GPT-5 Mini (High)56.4
9Kimi K2.5 (Thinking)55.4
10GPT-5 Mini (Medium)54.5
11GLM-5 (Thinking)48.5
12GPT-OSS-120B (Medium)48.5
13Gemini 3.1 Flash Lite (High)37.6
14Gemini 3.1 Flash Lite (Medium)33.7
15GPT-OSS-20B (Medium)23.8

Interactive version: theaggregate.ai/benchmark?slug=nvidia-computeeval-math-libs · How It Works · Data refreshed daily, snapshot 2026-09-19.