BioLing-7B-Dare: benchmark results

Provider: Other. Released 2024-04-01. Access: Open.

Unified ELO 1439 ± 14, rank #1819 of 2928 rated models, from 17 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Medical LLM - PubMedQA74.6Accuracy (%)62.5
Open LLM Leaderboard v1 - TruthfulQA MC253.75MC2 (%) (0-shot)60.6
Open LLM Leaderboard v1 - ARC Challenge61.77Normalized accuracy (%) (25-shot)54.4
Open LLM Leaderboard v1 - HellaSwag82.58Normalized accuracy (%) (10-shot)52.5
Open LLM Leaderboard v1 - WinoGrande76.95Accuracy (%) (5-shot)52
Open LLM Leaderboard v1 - MMLU60.54Accuracy (%) (5-shot)48.7
Open LLM Leaderboard v1 - GSM8K26.31Accuracy (%) (5-shot)44.5
Open Medical LLM - MMLU Professional Medicine66.54Accuracy (%)37.8
Open Medical LLM - MMLU Clinical Knowledge67.55Accuracy (%)36.9
Open Medical LLM - MMLU Medical Genetics69Accuracy (%)33.5
Open Medical LLM61.19Average Accuracy (%)31.8
Open Medical LLM - MMLU College Medicine58.96Accuracy (%)31.8

Interactive version: theaggregate.ai/model?slug=bioling-7b-dare · How It Works · Data refreshed daily, snapshot 2026-09-23.