HardSecBench - Refinement@5 (GPT-5.1 Collaborator) - Security: leaderboard

Metric: Requirement Pass Rate (%). Source: arxiv.org. 18 models tracked.

Top models

#ModelScore
1GPT-5.1 (Medium)53.88
2Gemini 3 Pro (Preview)52.49
3Gemini 2.5 Pro51.51
4GLM-4.651.1
5Qwen 3 14B50.42
6GPT-5 (Medium)50.42
7Llama 4 Maverick Instruct50.28
8O149.66
9DeepSeek V3.249
10Llama 4 Scout Instruct46.84
11GPT-OSS-120B46.21
12Qwen 3 Coder 480B A35B45.81
13Claude Opus 4.545.66
14Claude Sonnet 4.545.07
15Kimi K2 090545.03

Interactive version: theaggregate.ai/benchmark?slug=hardsecbench-refinement-5-gpt-5-1-collaborator-security · How It Works · Data refreshed daily, snapshot 2026-09-19.