medicine-chat: benchmark results

Provider: Other. Released 2023-06-01. Access: Open.

Unified ELO 1381 ± 14, rank #2273 of 2928 rated models, from 17 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Medical LLM - PubMedQA74.4Accuracy (%)59.4
Open LLM Leaderboard v1 - WinoGrande75.69Accuracy (%) (5-shot)43.6
Open LLM Leaderboard v1 - GSM8K18.95Accuracy (%) (5-shot)40.2
Open LLM Leaderboard v1 - ARC Challenge53.75Normalized accuracy (%) (25-shot)30.2
Open LLM Leaderboard v1 - MMLU49.98Accuracy (%) (5-shot)29.2
Open LLM Leaderboard v1 - HellaSwag76.11Normalized accuracy (%) (10-shot)28.1
Open LLM Leaderboard v1 - TruthfulQA MC243.46MC2 (%) (0-shot)23.6
Open Medical LLM - MMLU Anatomy50.37Accuracy (%)22.7
Open Medical LLM - MMLU College Medicine48.55Accuracy (%)19
Open Medical LLM50.06Average Accuracy (%)18.2
Open Medical LLM - MMLU Clinical Knowledge53.21Accuracy (%)18.2
Open Medical LLM - MMLU College Biology51.39Accuracy (%)18.2

Interactive version: theaggregate.ai/model?slug=medicine-chat · How It Works · Data refreshed daily, snapshot 2026-09-23.