LLMEval-Med - Medical Text Generation: leaderboard

Metric: Usability rate: share of responses physicians rate usable on five dimensions with a safety veto (%). Source: arxiv.org. Saturation forecast: Estimated already saturated. 13 models tracked.

Top models

#ModelScore
1GPT-4o64.58
2DeepSeek V349.48
3O1 Mini49.48
4O1 Preview49.48
5DeepSeek R144.33

Interactive version: theaggregate.ai/benchmark?slug=llmeval-med-medical-text-generation · How It Works · Data refreshed daily, snapshot 2026-09-25.