dolphin-2.9.1-llama-3-8B — benchmark results
Provider: Cognitive Computations. Released 2024-04-25. Access: Open.
Unified ELO 1327 ± 16, rank #1478 of 1776 rated models, from 28 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| MT-Bench PL - Math | 4.8 | Judge Score (0-10) | 49 |
| Open Medical LLM - MedMCQA | 49.94 | Accuracy (%) | 48.3 |
| Open Medical LLM - MMLU Clinical Knowledge | 70.19 | Accuracy (%) | 47.2 |
| MT-Bench PL - Roleplay | 7.4 | Judge Score (0-10) | 44.9 |
| Open Medical LLM - MMLU Medical Genetics | 71 | Accuracy (%) | 40.1 |
| MT-Bench PL - Coding | 4.6 | Judge Score (0-10) | 39.8 |
| Open Medical LLM - MedQA (USMLE) | 51.37 | Accuracy (%) | 38.9 |
| MT-Bench PL - Humanities | 8.8 | Judge Score (0-10) | 38.8 |
| Open Medical LLM - MMLU College Biology | 70.83 | Accuracy (%) | 37.2 |
| Open Chinese LLM - GSM8K | 38.51 | Accuracy (%) | 35.6 |
| Open Chinese LLM - TruthfulQA MC | 52.14 | Accuracy (%) | 34.7 |
| Open Medical LLM | 61.62 | Average Accuracy (%) | 34.7 |
Interactive version: theaggregate.ai/model?slug=dolphin-2-9-1-llama-3-8b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.