MedPIC-Bench - Counterfactual Pair: leaderboard

Metric: Both-correct pair rate (%). Source: arxiv.org. 28 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)48.3
2GPT-538.2
3DeepSeek V4 Pro32.6
4Qwen 3.5 Plus32.6
5Qwen 3.5 27B31.5
6GPT-OSS-120B30.3
7Qwen 3.5 35B A3B30.3
8GPT-5.229.2
9Lingshu-32B25.8
10GPT-OSS-20B24.7
11Qwen 3.5 9B24.7
12Claude Sonnet 4.621.3
13Gemini 2.5 Pro20.2
14Llama 3.1 70B16.9
15Lingshu-7B6.7

Interactive version: theaggregate.ai/benchmark?slug=medpic-bench-counterfactual-pair · How It Works · Data refreshed daily, snapshot 2026-09-19.