MedPIC-Bench - Rule Activation: leaderboard

Metric: Accuracy (%). Source: arxiv.org. 28 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)74.6
2GPT-570.4
3Qwen 3.5 35B A3B70.4
4DeepSeek V4 Pro67.6
5Qwen 3.5 27B67.6
6Qwen 3.5 Plus66.2
7Gemini 2.5 Pro63.4
8GPT-5.263.4
9Llama 3.1 70B63.4
10Claude Sonnet 4.662
11GPT-OSS-120B62
12Lingshu-32B60.6
13Gemma 3 12B57.7
14Qwen 3.5 9B54.9
15Llama 3.1 8B54.9

Interactive version: theaggregate.ai/benchmark?slug=medpic-bench-rule-activation · How It Works · Data refreshed daily, snapshot 2026-09-19.