dolphin-2.9.1-llama-3-8B — benchmark results

Provider: Cognitive Computations. Released 2024-04-25. Access: Open.

Unified ELO 1327 ± 16, rank #1478 of 1776 rated models, from 28 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
MT-Bench PL - Math4.8Judge Score (0-10)49
Open Medical LLM - MedMCQA49.94Accuracy (%)48.3
Open Medical LLM - MMLU Clinical Knowledge70.19Accuracy (%)47.2
MT-Bench PL - Roleplay7.4Judge Score (0-10)44.9
Open Medical LLM - MMLU Medical Genetics71Accuracy (%)40.1
MT-Bench PL - Coding4.6Judge Score (0-10)39.8
Open Medical LLM - MedQA (USMLE)51.37Accuracy (%)38.9
MT-Bench PL - Humanities8.8Judge Score (0-10)38.8
Open Medical LLM - MMLU College Biology70.83Accuracy (%)37.2
Open Chinese LLM - GSM8K38.51Accuracy (%)35.6
Open Chinese LLM - TruthfulQA MC52.14Accuracy (%)34.7
Open Medical LLM61.62Average Accuracy (%)34.7

Interactive version: theaggregate.ai/model?slug=dolphin-2-9-1-llama-3-8b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.