Open Medical LLM - PubMedQA — leaderboard
Metric: Accuracy (%). Source: huggingface.co. 181 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Llama 3 8B Ita | 78.4 |
| 2 | Llama-3-SauerkrautLM-8B-Instruct | 78.4 |
| 3 | Starling-LM-7B-beta | 78.2 |
| 4 | NeuralLLaMa-3-8B-DT-v0.1 | 77.6 |
| 5 | Barcenas-Llama3-8B-ORPO | 77.6 |
| 6 | Daredevil-8B-abliterated | 77 |
| 7 | NeuralLLaMa-3-8B-ORPO-v0.3 | 77 |
| 8 | zephyr-7B-beta | 76.6 |
| 9 | L-MChat-7B | 76.6 |
| 10 | ChimeraLlama-3-8B-v3 | 76.4 |
| 11 | gemma-7B | 76.2 |
| 12 | BeagSake-7B | 76 |
| 13 | Mistral 7B Instruct (v0.1) | 75.8 |
| 14 | Mistral-7B-v0.1 | 75.4 |
| 15 | SeaLLM-7B-v2.5 | 75 |
Interactive version: theaggregate.ai/benchmark?slug=open-medical-llm-pubmedqa · How the rankings work · Data refreshed daily, snapshot 2026-07-22.