HardSecBench - Refinement@5 (GPT-5.1 Collaborator) - Functional: leaderboard

Metric: Requirement Pass Rate (%). Source: arxiv.org. 18 models tracked.

Top models

#ModelScore
1DeepSeek V3.299.26
2Gemini 3 Pro (Preview)99.08
3O198.97
4Claude Sonnet 4.598.88
5GPT-5 (Medium)98.82
6GLM-4.698.8
7GPT-5.1 (Medium)98.76
8Gemini 2.5 Flash98.75
9Gemini 2.5 Pro98.72
10Qwen 3 14B98.68
11Kimi K2 090598.59
12Qwen 3 Coder 480B A35B98.58
13GPT-OSS-120B98.43
14Llama 4 Scout Instruct98.2
15Qwen 3 Max98.11

Interactive version: theaggregate.ai/benchmark?slug=hardsecbench-refinement-5-gpt-5-1-collaborator-functional · How It Works · Data refreshed daily, snapshot 2026-09-19.