Agent Security League - Functional Correctness: leaderboard

Metric: Functional Correctness (%). Source: www.endorlabs.com. 19 models tracked.

Top models

#ModelScore
1GPT-5.584.9
2Claude Opus 4.684.9
3Claude Sonnet 583.2
4GLM-5.282.5
5Claude Opus 4.779.9
6Gemini 3.5 Flash79.3
7Claude Opus 4.875.4
8Composer 2.575.4
9Claude Opus 573.7
10Gemini 3.1 Pro (Preview)73.2
11Claude Fable 572.6
12GPT-5.6 Sol70.9
13Claude Sonnet 4.669.8
14Claude Opus 4.568.7
15GPT-5.463.1

Interactive version: theaggregate.ai/benchmark?slug=agent-security-league-functional-correctness · How It Works · Data refreshed daily, snapshot 2026-09-05.