Open Medical LLM - MedQA (USMLE) — leaderboard
Metric: Accuracy (%). Source: huggingface.co. 181 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | NeuralLLaMa-3-8B-DT-v0.1 | 61.67 |
| 2 | Daredevil-8B-abliterated | 61.27 |
| 3 | ChimeraLlama-3-8B-v3 | 61.27 |
| 4 | NeuralLLaMa-3-8B-ORPO-v0.3 | 61.19 |
| 5 | Meta-Llama-3-8B-Instruct-abliterated-v3 | 61.04 |
| 6 | Llama-3-8B-Instruct-abliterated-v2 | 60.96 |
| 7 | Barcenas-Llama3-8B-ORPO | 60.88 |
| 8 | Llama 3 8B Instruct | 60.72 |
| 9 | Llama 3 8B Ita | 60.72 |
| 10 | Llama-3-SauerkrautLM-8B-Instruct | 60.57 |
| 11 | suzume-llama-3-8B-multilingual | 60.09 |
| 12 | Llama 3 8B | 59.7 |
| 13 | Llama-3-Smaug-8B | 59.31 |
| 14 | CarbonBeagle-11B-truthy | 55.54 |
| 15 | Yi-1.5-9B | 55.38 |
Interactive version: theaggregate.ai/benchmark?slug=open-medical-llm-medqa-usmle · How the rankings work · Data refreshed daily, snapshot 2026-07-22.