CureMed-Bench - Language Consistency: leaderboard

Metric: Language consistency (%; share of final answers written in the language of the question, pooled over 1,431 held-out open-ended medical questions in 13 languages; zero-shot). Source: arxiv.org. Saturation forecast: Estimated already saturated. 49 models tracked.

Top models

#ModelScore
1Claude 3 Haiku93.43
2Llama 3.3 70B Instruct79.66
3Llama 3.1 70B75.68
4GPT-5 Mini75.33
5Qwen 2.5 72B Instruct70.73
6GPT-5 Nano69.11
7Qwen 3 32B55.83
8Gemini 2.5 Flash48.01
9Ministral 8B46.93
10Qwen 3 14B43.71
11Qwen 2.5 32B Instruct41.51
12Llama 3.1 8B Instruct36.56
13Qwen 2.5 14B Instruct35.57
14Qwen 3 8B33.96
15Llama 3 8B31.58

Interactive version: theaggregate.ai/benchmark?slug=curemed-bench-language-consistency · How It Works · Data refreshed daily, snapshot 2026-09-26.