MedPIC-Bench - Overall: leaderboard

Metric: Accuracy (%). Source: arxiv.org. 28 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)80.7
2GPT-575.6
3Qwen 3.5 Plus72.4
4DeepSeek V4 Pro71.7
5GPT-OSS-120B70.7
6Qwen 3.5 27B69.4
7Qwen 3.5 35B A3B68.5
8GPT-5.268.1
9Claude Sonnet 4.664.2
10Qwen 3.5 9B63.8
11Lingshu-32B59.5
12GPT-OSS-20B59.1
13Llama 3.1 70B55.7
14Gemini 2.5 Pro54.4
15Lingshu-7B43.3

Interactive version: theaggregate.ai/benchmark?slug=medpic-bench-overall · How It Works · Data refreshed daily, snapshot 2026-09-19.