BigCodeBench-Hard: leaderboard

BigCodeBench-Hard evaluates code generation on the harder BigCodeBench subset, reporting pass@1 in complete and instruct settings.

Metric: Instruct pass@1 (self-reported). Source: benchmarklist.com. Status: saturated. 20 models tracked.

Top models

#ModelScore
1O3 Mini (2025-01-31)33.1
2Claude 3.7 Sonnet (20250219)32.4
3O1 (2024-12-17)32.4
4GPT-4.1 Mini31.8
5GPT-4.131.8
6Grok 3 Mini Beta31.1
7Gemini 2.5 Pro (Preview 03-25)29.7
8DeepSeek R129.7
9GPT-4 Turbo29.1
10Qwen 2.5 Max29.1
11Llama 3.3 70B Instruct28.4
12GPT-4.1 Nano28.4
13DeepSeek V328.4
14GPT-4o (2024-11-20)27.7
15Qwen 2.5 Coder 32B Instruct27.7

Interactive version: theaggregate.ai/benchmark?slug=bigcodebench-hard · How It Works · Data refreshed daily, snapshot 2026-09-05.