MedGUIDE: leaderboard

Metric: Weighted Accuracy (self-reported). Source: benchmarklist.com. 25 models tracked.

Top models

#ModelScore
1GPT-4.162.54
2O160.49
3O4 Mini58.9
4DeepSeek R158.12
5DeepSeek V357.7
6Claude 3.7 Sonnet (20250219)55.62
7Llama 3.1 70B Instruct54.31
8Qwen 3 32B53.66
9Qwen 3 14B53.54
10GPT-4o Mini53.42
11Qwen 2.5 7B Instruct50.07
12Mixtral 8x7B Instruct (v0.1)49.15
13Mistral 7B Instruct (v0.3)48.13
14Claude 3.5 Haiku (20241022)47.55
15Qwen 3 8B47.33

Interactive version: theaggregate.ai/benchmark?slug=medguide · How It Works · Data refreshed daily, snapshot 2026-09-05.