GPAgentBench-2K - Management Accuracy: leaderboard

Metric: Management accuracy (%; episodes ending in the correct pathway, local treatment or specialist referral, checked deterministically; zero-shot GP agent with six clinical actions over 2,428 physician-validated primary-care cases, GPT-4o-mini patient simulator, at most 10 turns). Source: arxiv.org. Saturation forecast: Around 2031. 21 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.660.2
2DeepSeek V4 Pro56.7
3GPT-5.456.3
4Qwen 3.7 Max56.1
5Gemini 3.1 Pro (Preview)55.9
6Claude Opus 4.755.9
7MiMo-V2.5-Pro55.3
8GLM-5.154.4
9Lingshu-32B53.6
10DeepSeek V4 Flash53.2
11MiniMax-M2.753
12MedGemma-27B52
13Lingshu-7B44.5
14Kimi K2.641.2

Interactive version: theaggregate.ai/benchmark?slug=gpagentbench-2k-management-accuracy · How It Works · Data refreshed daily, snapshot 2026-09-26.