Open Medical-LLM Leaderboard: leaderboard

Open Life Science AI leaderboard evaluating LLMs on medical QA and medical MMLU tasks, including PubMedQA, MedQA, MedMCQA, and six medical MMLU subjects.

Metric: Average Accuracy (%). Source: huggingface.co. Status: saturated. 181 models tracked.

Top models

#ModelScore
1Daredevil-8B-abliterated70.86
2NeuralLLaMa-3-8B-DT-v0.170.43
3NeuralLLaMa-3-8B-ORPO-v0.370.4
4Llama 3 8B Ita70.11
5ChimeraLlama-3-8B-v370.04
6Barcenas-Llama3-8B-ORPO69.93
7Llama 3 8B69.9
8Llama-3-SauerkrautLM-8B-Instruct69.76
9suzume-llama-3-8B-multilingual69.3
10Llama 3 8B Instruct68.99
11Yi-1.5-9B68.89
12Meta-Llama-3-8B-Instruct-abliterated-v368.84
13Llama-3-8B-Instruct-abliterated-v268.05
14Yi-1.5-9B-32K67.73
15Liberated-Qwen1.5-14B67.66

Interactive version: theaggregate.ai/benchmark?slug=open-medical-llm-leaderboard · How It Works · Data refreshed daily, snapshot 2026-09-05.