AA APEX-Agents — leaderboard

Artificial Analysis APEX-Agents: 452 long-horizon professional tasks across investment banking, management consulting, and corporate law testing agentic capabilities.

Metric: Pass@1 (%). Source: artificialanalysis.ai. Status: saturation imminent. 29 models tracked.

Top models

#ModelScore
1Gemini 3.5 Flash (High)47.05
2Kimi K341.3
3GPT-5.6 Terra (Max)38.94
4GPT-5.5 (xHigh)37.68
5GPT-5.6 Luna (Max)35.84
6GLM-5.2 (Max)33.7
7GPT-5.4 (xHigh)33.26
8Claude Opus 4.6 (Adaptive Reasoning, Max Effort)33.04
9Gemini 3.1 Pro (Preview)32.01
10Kimi K2.628.47
11GPT-5.4 Mini (xHigh)28.17
12Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)28.02
13GPT-5.4 Nano (xHigh)24.93
14DeepSeek V4 Pro (Reasoning, Max Effort)24.26
15Qwen 3.7 Plus22.42

Interactive version: theaggregate.ai/benchmark?slug=aa-apex-agents · How the rankings work · Data refreshed daily, snapshot 2026-07-22.