MedPIC-Bench - Guideline-Following: leaderboard

Metric: Accuracy (%). Source: arxiv.org. 28 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)87.7
2GPT-583.5
3Qwen 3.5 Plus81.7
4DeepSeek V4 Pro81.3
5GPT-OSS-120B79.6
6GPT-5.278.2
7Qwen 3.5 27B78.2
8Qwen 3.5 35B A3B77.5
9Claude Sonnet 4.674.6
10Qwen 3.5 9B73.9
11GPT-OSS-20B66.5
12Lingshu-32B63.7
13Llama 3.1 70B61.3
14Gemini 2.5 Pro60.6
15Lingshu-7B50.7

Interactive version: theaggregate.ai/benchmark?slug=medpic-bench-guideline-following · How It Works · Data refreshed daily, snapshot 2026-09-19.