HardSecBench - Single Attempt@1 - Functional: leaderboard

Metric: Requirement Pass Rate (%). Source: arxiv.org. 18 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)93.93
2Claude Opus 4.591.72
3GPT-5.1 (Medium)91.68
4Gemini 2.5 Pro91.43
5GPT-5 (Medium)91.35
6Gemini 2.5 Flash89.85
7O189.15
8GPT-OSS-120B88.64
9Kimi K2 090588.53
10Claude Sonnet 4.587.86
11GLM-4.686.18
12DeepSeek V3.285.33
13Qwen 3 Coder 480B A35B85.2
14Llama 4 Maverick Instruct84.72
15Qwen 3 Max84.13

Interactive version: theaggregate.ai/benchmark?slug=hardsecbench-single-attempt-1-functional · How It Works · Data refreshed daily, snapshot 2026-09-19.