AutoBaxBench - Hard - Correct & Secure: leaderboard

Metric: Correct and secure solutions, sec_pass@1 (%). Source: baxbench.com. 14 models tracked.

Top models

#ModelScore
1GPT-530.71
2Claude Sonnet 4.525.08
3Gemini 3 Pro24.9
4Claude Sonnet 422.14
5Claude 3.7 Sonnet17.14
6Gemini 2.5 Pro16.43
7Grok 416.43
8DeepSeek R18.57
9Qwen3 Coder3.57
10Llama 3.3 70B0.71
11GPT-4o0.48
12Qwen 2.5 72B0.48
13Qwen 2.5 7B0

Interactive version: theaggregate.ai/benchmark?slug=autobaxbench-hard-correct-secure · How It Works · Data refreshed daily, snapshot 2026-09-19.