AutoBaxBench - Medium - Correct: leaderboard

Metric: Correct solutions, pass@1 (%). Source: baxbench.com. 14 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.583.99
2Claude Sonnet 477.86
3Gemini 3 Pro77.45
4GPT-558.57
5Grok 450.46
6Claude 3.7 Sonnet49.64
7DeepSeek R142.14
8Gemini 2.5 Pro40.71
9Qwen3 Coder29.64
10GPT-4o15.71
11Llama 3.3 70B7.38
12Qwen 2.5 72B5.13
13Qwen 2.5 7B0.48

Interactive version: theaggregate.ai/benchmark?slug=autobaxbench-medium-correct · How It Works · Data refreshed daily, snapshot 2026-09-19.