Starling-LM-7B-beta — benchmark results

Provider: UC Berkeley. Released 2023-11-30. Access: Open.

Unified ELO 1362 ± 26, rank #1369 of 1776 rated models, from 73 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Medical LLM - PubMedQA78.2Accuracy (%)96.3
BiGGen-Bench3.76Average Score (1-5)82.4
EuroEval Spanish NLU - Sentiment Headlines ES46.53Sentiment classification Score (%)75.2
Open Medical LLM - MMLU College Medicine65.32Accuracy (%)69.3
Open PL LLM - Generative58.61Average Generative Score (%)68.2
EuroEval Italian NLU - MultiNERD IT67.92Named entity recognition Score (%)67.7
EuroEval Portuguese NLU - MultiWikiQA PT71.83Reading comprehension Score (%)66.2
Open PL LLM - Multiple Choice48.68Average Multiple-Choice Score (%)66.1
Open PL LLM Leaderboard54.18Average Score (%)66.1
Open PL LLM - RAG65.15Average RAG Score (%)65.7
Open Medical LLM - MMLU Anatomy64.44Accuracy (%)65.1
EuroEval Portuguese Common Sense Reasoning58.41Common Sense Reasoning Average Score (%)65

Interactive version: theaggregate.ai/model?slug=starling-lm-7b-beta · How the rankings work · Data refreshed daily, snapshot 2026-07-22.