MedAgentGym — leaderboard

Metric: Average Score (self-reported). Source: benchmarklist.com. 29 models tracked.

Top models

#ModelScore
1GPT-4.170.15
2GPT-4.1 Mini61.72
3QwQ-32B51.5
4DeepSeek R1 Distill Llama 70B50.07
5GPT-4o (2024-08-06)48.75
6Qwen 3 32B48.19
7Qwen 2.5 32B Instruct42.68
8GPT-4o Mini37.47
9Llama 3.3 70B Instruct37.04
10Qwen 2.5 Coder 14B Instruct32.89
11Qwen 3 14B31.6
12Qwen 3 8B30.83
13DeepSeek R1 Distill Qwen 14B30.51
14Qwen 3 4B27.29
15Ministral-8B-Instruct-241022.27

Interactive version: theaggregate.ai/benchmark?slug=medagentgym · How the rankings work · Data refreshed daily, snapshot 2026-07-22.