AutoBaxBench - Hard - Correct: leaderboard

Metric: Correct solutions, pass@1 (%). Source: baxbench.com. 14 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.582.86
2Gemini 3 Pro76.17
3Claude Sonnet 468.57
4Claude 3.7 Sonnet64.76
5GPT-559.29
6Grok 442.14
7DeepSeek R135
8Gemini 2.5 Pro31.43
9Qwen3 Coder21.75
10GPT-4o10.71
11Llama 3.3 70B2.86
12Qwen 2.5 72B2.38
13Qwen 2.5 7B0.24

Interactive version: theaggregate.ai/benchmark?slug=autobaxbench-hard-correct · How It Works · Data refreshed daily, snapshot 2026-09-19.