HardSecBench - Refinement@1 (GPT-5.1 Collaborator) - Functional: leaderboard

Metric: Requirement Pass Rate (%). Source: arxiv.org. 18 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)97.71
2GPT-5.1 (Medium)97.27
3Claude Opus 4.597.11
4DeepSeek V3.297.03
5Gemini 2.5 Pro96.57
6GPT-OSS-120B96.33
7O196.31
8Kimi K2 090596.18
9GPT-5 (Medium)95.98
10GLM-4.695.93
11Qwen 3 Coder 480B A35B95.71
12Gemini 2.5 Flash95.68
13Llama 4 Scout Instruct95.67
14Llama 4 Maverick Instruct95.4
15Claude Sonnet 4.595.39

Interactive version: theaggregate.ai/benchmark?slug=hardsecbench-refinement-1-gpt-5-1-collaborator-functional · How It Works · Data refreshed daily, snapshot 2026-09-19.