AutoBaxBench - Easy - Correct: leaderboard

Metric: Correct solutions, pass@1 (%). Source: baxbench.com. 14 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.580.82
2Claude Sonnet 480
3Claude 3.7 Sonnet74.29
4Gemini 3 Pro73.25
5GPT-571.43
6Gemini 2.5 Pro59.29
7Grok 456.43
8DeepSeek R155
9Qwen3 Coder44.29
10GPT-4o39.76
11Qwen 2.5 72B22.38
12Llama 3.3 70B19.05
13Qwen 2.5 7B4.79

Interactive version: theaggregate.ai/benchmark?slug=autobaxbench-easy-correct · How It Works · Data refreshed daily, snapshot 2026-09-19.