Agent Security League - Security Correctness: leaderboard

Metric: Security Correctness (%). Source: www.endorlabs.com. 19 models tracked.

Top models

#ModelScore
1Claude Opus 532.4
2Claude Fable 529
3GPT-5.524
4GPT-5.6 Sol23.5
5GPT-5.421.8
6Claude Opus 4.820.7
7Claude Sonnet 519.6
8Claude Opus 4.718.4
9Gemini 3.5 Flash17.9
10Gemini 3.1 Pro (Preview)15.1
11GPT-5.314.5
12Composer 2.514
13Claude Sonnet 4.612.3
14GLM-5.212
15Claude Opus 4.611.2

Interactive version: theaggregate.ai/benchmark?slug=agent-security-league-security-correctness · How It Works · Data refreshed daily, snapshot 2026-09-05.