Starling-LM-7B-beta — benchmark results
Provider: UC Berkeley. Released 2023-11-30. Access: Open.
Unified ELO 1362 ± 26, rank #1369 of 1776 rated models, from 73 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open Medical LLM - PubMedQA | 78.2 | Accuracy (%) | 96.3 |
| BiGGen-Bench | 3.76 | Average Score (1-5) | 82.4 |
| EuroEval Spanish NLU - Sentiment Headlines ES | 46.53 | Sentiment classification Score (%) | 75.2 |
| Open Medical LLM - MMLU College Medicine | 65.32 | Accuracy (%) | 69.3 |
| Open PL LLM - Generative | 58.61 | Average Generative Score (%) | 68.2 |
| EuroEval Italian NLU - MultiNERD IT | 67.92 | Named entity recognition Score (%) | 67.7 |
| EuroEval Portuguese NLU - MultiWikiQA PT | 71.83 | Reading comprehension Score (%) | 66.2 |
| Open PL LLM - Multiple Choice | 48.68 | Average Multiple-Choice Score (%) | 66.1 |
| Open PL LLM Leaderboard | 54.18 | Average Score (%) | 66.1 |
| Open PL LLM - RAG | 65.15 | Average RAG Score (%) | 65.7 |
| Open Medical LLM - MMLU Anatomy | 64.44 | Accuracy (%) | 65.1 |
| EuroEval Portuguese Common Sense Reasoning | 58.41 | Common Sense Reasoning Average Score (%) | 65 |
Interactive version: theaggregate.ai/model?slug=starling-lm-7b-beta · How the rankings work · Data refreshed daily, snapshot 2026-07-22.