SecRepoBench (Standalone) - Pass@1: leaderboard

Metric: Completions that pass the unit tests, pass@1 (%). Source: secrepobench.github.io. 29 models tracked.

Top models

#ModelScore
1GPT-5 (Medium)54.1
2Claude Sonnet 4.5 (Thinking)52.2
3Claude Sonnet 4 (Thinking)48.4
4Gemini 3 Pro48.1
5O3 (Medium)47.5
6GPT-4.143.4
7Qwen3 Coder41.2
8Claude 3.7 Sonnet (Thinking)40.3
9DeepSeek V339.6
10O1 (Medium)38.4
11O4 Mini (Medium)36.8
12Claude 3.5 Sonnet36.5
13GPT-4o (2024-11-20)34.9
14DeepSeek R134.3
15GPT-OSS-120B (Medium)34

Interactive version: theaggregate.ai/benchmark?slug=secrepobench-standalone-pass-1 · How It Works · Data refreshed daily, snapshot 2026-09-19.