BigCode Models Leaderboard: leaderboard

Leaderboard evaluating code generation models on HumanEval, MultiPL-E, DS-1000, and related benchmarks. Covers 60+ models including StarCoder, CodeLlama, Qwen-Coder, and DeepSeek-Coder variants.

Metric: HumanEval Python Pass@1 (%). Source: huggingface.co. Status: saturated. 60 models tracked.

Top models

#ModelScore
1Nxcode-CQ-7B-orpo87.2
2Qwen 2.5 Coder 32B Instruct83.2
3Qwen 2.5 Coder 32B57.1
4deepseek-coder-33B-base52.5
5Phi-151.2
6CodeQwen1.5-7B50.8
7starcoder2-15B44.1
8starcoder2-7B34.1
9starcoder2-3B31.4

Interactive version: theaggregate.ai/benchmark?slug=bigcode-models-leaderboard · How It Works · Data refreshed daily, snapshot 2026-09-05.