GPAgentBench-2K - Missed Local Management Rate: leaderboard

Metric: Missed local management rate (%; locally manageable cases the agent referred unnecessarily; lower is better; zero-shot GP agent with six clinical actions over 2,428 physician-validated primary-care cases, GPT-4o-mini patient simulator, at most 10 turns). Source: arxiv.org. Saturation forecast: Around 2028. 21 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.613.4
2MiniMax-M2.725
3Claude Opus 4.727.8
4Qwen 3.7 Max29.2
5Lingshu-7B31
6DeepSeek V4 Pro33.5
7MiMo-V2.5-Pro34.5
8Lingshu-32B35.2
9MedGemma-27B35.2
10GPT-5.438.4
11Gemini 3.1 Pro (Preview)41.5
12GLM-5.141.5
13DeepSeek V4 Flash45.1
14Kimi K2.671.8

Interactive version: theaggregate.ai/benchmark?slug=gpagentbench-2k-missed-local-management-rate · How It Works · Data refreshed daily, snapshot 2026-09-26.