CureMed-Bench: leaderboard

Metric: Logical accuracy (%; share of final answers a GPT-4o judge matches to the reference answer, pooled over 1,431 held-out open-ended medical questions in 13 languages; zero-shot). Source: arxiv.org. Saturation forecast: Around December 2026. 49 models tracked.

Top models

#ModelScore
1GPT-5 Mini80.57
2Claude 3 Haiku73.31
3GPT-5 Nano73.24
4Llama 3.3 70B Instruct60.8
5Qwen 2.5 72B Instruct58.8
6Gemini 2.5 Flash54.79
7Llama 3.1 70B54.65
8Qwen 2.5 32B Instruct49.69
9Qwen 3 32B48.57
10Ministral 8B42.87
11Qwen 2.5 14B Instruct41.79
12DeepSeek R1 Distill Qwen 32B40.27
13Qwen 3 14B38.62
14Gemma 2 9B36.97
15DeepSeek R1 Distill Qwen 14B33.18

Interactive version: theaggregate.ai/benchmark?slug=curemed-bench · How It Works · Data refreshed daily, snapshot 2026-09-26.