Open Medical LLM — leaderboard

Medical QA leaderboard evaluating LLMs on 9 clinical benchmarks: MedQA (USMLE), MedMCQA, PubMedQA, and 6 MMLU medical subsets. Zero-shot accuracy.

Metric: Average Accuracy (%). Source: huggingface.co. Status: saturation imminent. 181 models tracked.

Top models

#ModelScore
1Daredevil-8B-abliterated70.86
2NeuralLLaMa-3-8B-DT-v0.170.43
3NeuralLLaMa-3-8B-ORPO-v0.370.4
4Llama 3 8B Ita70.11
5ChimeraLlama-3-8B-v370.04
6Barcenas-Llama3-8B-ORPO69.93
7Llama 3 8B69.9
8Llama-3-SauerkrautLM-8B-Instruct69.76
9suzume-llama-3-8B-multilingual69.3
10Llama 3 8B Instruct68.99
11Yi-1.5-9B68.89
12Meta-Llama-3-8B-Instruct-abliterated-v368.84
13Llama-3-8B-Instruct-abliterated-v268.05
14Yi-1.5-9B-32K67.73
15Liberated-Qwen1.5-14B67.66

Interactive version: theaggregate.ai/benchmark?slug=open-medical-llm · How the rankings work · Data refreshed daily, snapshot 2026-07-22.