Agent Security League - Functional Correctness — leaderboard

Metric: Functional Correctness (%). Source: www.endorlabs.com. 18 models tracked.

Top models

#ModelScore
1GPT-5.584.9
2Claude Opus 4.684.9
3Claude Sonnet 583.2
4GLM-5.282.5
5Claude Opus 4.779.9
6Gemini 3.5 Flash79.3
7Claude Opus 4.875.4
8Gemini 3.1 Pro (Preview)73.2
9Claude Fable 572.6
10GPT-5.6 Sol70.9
11Claude Sonnet 4.669.8
12Claude Opus 4.568.7
13GPT-5.463.1
14Claude Sonnet 455.3
15Gemini 3 Pro44.1

Interactive version: theaggregate.ai/benchmark?slug=agent-security-league-functional-correctness · How the rankings work · Data refreshed daily, snapshot 2026-07-22.