Starling-LM-7B-beta: benchmark results

Provider: UC Berkeley. Released 2023-11-30. Access: Open.

Unified ELO 1468 ± 1, rank #853 of 1392 rated models, from 76 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Medical LLM - PubMedQA78.2Accuracy (%)96.3
BiGGen-Bench3.76Average Score (1-5)82.4
Enkrypt AI - Toxicity Risk1.52Risk Score77.5
EuroEval Spanish NLU - Sentiment Headlines ES46.53Sentiment classification Score (%)75.2
Open Medical LLM - MMLU College Medicine65.32Accuracy (%)69.3
Open PL LLM - Generative58.61Average Generative Score (%)68.2
EuroEval Italian NLU - MultiNERD IT67.92Named entity recognition Score (%)67.7
Enkrypt AI - Bias Risk78.81Risk Score66.9
EuroEval Portuguese NLU - MultiWikiQA PT71.83Reading comprehension Score (%)66.2
Open PL LLM - Multiple Choice48.68Average Multiple-Choice Score (%)66.1
Open PL LLM Leaderboard54.18Average Score (%)66.1
Open PL LLM - RAG65.15Average RAG Score (%)65.7

Interactive version: theaggregate.ai/model?slug=starling-lm-7b-beta · How It Works · Data refreshed daily, snapshot 2026-09-05.