AA APEX-Agents: leaderboard

Artificial Analysis APEX-Agents: 452 long-horizon professional tasks across investment banking, management consulting, and corporate law testing agentic capabilities.

Metric: Pass@1 (%). Source: artificialanalysis.ai. Status: years away from saturation. 30 models tracked.

Top models

#ModelScore
1Gemini 3.5 Flash (High)47.05
2Kimi K3 (Max)41.3
3GPT-5.6 Terra (Max)38.94
4GPT-5.5 (xHigh)37.68
5GPT-5.6 Luna (Max)35.84
6GLM-5.2 (Max)33.7
7GPT-5.4 (xHigh)33.26
8Claude Opus 4.6 (Adaptive Reasoning, Max Effort)33.04
9Gemini 3.1 Pro (Preview)32.01
10Kimi K2.628.47
11GPT-5.4 Mini (xHigh)28.17
12Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)28.02
13Gemini 3 Flash (Preview) (Reasoning)27.73
14GPT-5.4 Nano (xHigh)24.93
15DeepSeek V4 Pro (Reasoning, Max Effort)24.26

Interactive version: theaggregate.ai/benchmark?slug=aa-apex-agents · How It Works · Data refreshed daily, snapshot 2026-09-05.