Medmarks - MMLU-Pro Health — leaderboard

Metric: Score (%). Source: medmarks.ai. 71 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.583.86
2Gemini 3 Pro (Preview)83.74
3MiniMax-M2.182.97
4Grok 482.44
5GPT-5.1 (Medium)82.15
6GPT-5.2 (Medium)81.38
7GLM-4.7 FP880.07
8Qwen 3 235B A22B (Thinking)78.69
9MiniMax-M278.44
10Qwen 3 Next 80B A3B Instruct77.75
11Qwen 3 Next 80B A3B (Thinking)76.94
12INTELLECT-376.69
13GPT-OSS-120B (High)76.12
14Qwen 3 VL 30B A3B (Thinking)75.96
15GPT-OSS-120B (Medium)75.96

Interactive version: theaggregate.ai/benchmark?slug=medmarks-mmlu-pro-health · How the rankings work · Data refreshed daily, snapshot 2026-07-22.