MedPIC-Bench - Rule Deactivation: leaderboard

Metric: Accuracy (%). Source: arxiv.org. 28 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)77.9
2GPT-561.8
3GPT-OSS-120B55.9
4Qwen 3.5 Plus55.9
5Lingshu-32B54.4
6Qwen 3.5 27B51.5
7DeepSeek V4 Pro50
8GPT-OSS-20B48.5
9Qwen 3.5 9B47.1
10Qwen 3.5 35B A3B45.6
11GPT-5.242.6
12Claude Sonnet 4.635.3
13Llama 3.1 70B32.4
14Lingshu-7B32.4
15Gemini 2.5 Pro27.9

Interactive version: theaggregate.ai/benchmark?slug=medpic-bench-rule-deactivation · How It Works · Data refreshed daily, snapshot 2026-09-19.