HardSecBench - Refinement@1 (GPT-5.1 Collaborator) - Security: leaderboard

Metric: Requirement Pass Rate (%). Source: arxiv.org. 18 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)46.11
2GPT-5.1 (Medium)45.76
3Gemini 2.5 Pro44.56
4Llama 4 Maverick Instruct44.38
5GPT-5 (Medium)42.96
6Claude Opus 4.542.91
7GLM-4.642.89
8DeepSeek V3.242.42
9O141.66
10GPT-OSS-120B40.73
11Llama 4 Scout Instruct40.66
12Qwen 3 14B40.57
13Qwen 3 Coder 480B A35B39.74
14Kimi K2 090539.09
15Claude Sonnet 4.538.68

Interactive version: theaggregate.ai/benchmark?slug=hardsecbench-refinement-1-gpt-5-1-collaborator-security · How It Works · Data refreshed daily, snapshot 2026-09-19.