APEX-Agents (DualViewEval Study): leaderboard

Metric: Score (%). Source: arxiv.org. 26 models tracked.

Top models

#ModelScore
1Claude Opus 4.852.27
2Gemini 3.5 Flash45.19
3GPT-5.444.83
4GPT-5.543.68
5GLM-5.243.25
6Kimi K2.637.62
7Claude Opus 4.735.04
8GLM-5.134.62
9Qwen 3.7 Max32.45
10Seed 2.1 Pro32.01
11Gemini 3 Flash31.81
12Claude Opus 4.630.83
13Seed 2.0 Pro29.29
14Qwen 3.7 Plus24.25
15Kimi K2.523.53

Interactive version: theaggregate.ai/benchmark?slug=apex-agents-dualvieweval-study · How It Works · Data refreshed daily, snapshot 2026-09-21.