Agent Security League - Security Correctness — leaderboard

Metric: Security Correctness (%). Source: www.endorlabs.com. 18 models tracked.

Top models

#ModelScore
1Claude Fable 529
2GPT-5.524
3GPT-5.6 Sol23.5
4GPT-5.421.8
5Claude Opus 4.820.7
6Claude Sonnet 519.6
7Claude Opus 4.718.4
8Gemini 3.5 Flash17.9
9Gemini 3.1 Pro (Preview)15.1
10Claude Sonnet 4.612.3
11GLM-5.212
12Claude Opus 4.611.2
13Gemini 3 Pro9.5
14Claude Opus 4.58.4
15Claude Sonnet 47.8

Interactive version: theaggregate.ai/benchmark?slug=agent-security-league-security-correctness · How the rankings work · Data refreshed daily, snapshot 2026-07-22.