MedGUIDE — leaderboard

Metric: Weighted Accuracy (self-reported). Source: benchmarklist.com. 25 models tracked.

Top models

#ModelScore
1GPT-4.162.5
2O160.5
3O4 Mini58.9
4DeepSeek V357.7
5Claude 3.7 Sonnet55.6
6Llama 3.1 70B Instruct54.3
7Qwen 3 32B53.7
8Qwen 3 14B53.5
9GPT-4o Mini53.4
10Qwen 2.5 7B Instruct50.1
11Mistral 7B Instruct (v0.3)48.1
12Claude 3.5 Haiku47.5
13Qwen 3 8B47.3
14Llama 3.1 8B Instruct47.1
15Qwen 3 4B46.2

Interactive version: theaggregate.ai/benchmark?slug=medguide · How the rankings work · Data refreshed daily, snapshot 2026-07-22.