Starling-LM-7B-beta: benchmark results
Provider: UC Berkeley. Released 2023-11-30. Access: Open.
Unified ELO 1468 ± 1, rank #853 of 1392 rated models, from 76 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open Medical LLM - PubMedQA | 78.2 | Accuracy (%) | 96.3 |
| BiGGen-Bench | 3.76 | Average Score (1-5) | 82.4 |
| Enkrypt AI - Toxicity Risk | 1.52 | Risk Score | 77.5 |
| EuroEval Spanish NLU - Sentiment Headlines ES | 46.53 | Sentiment classification Score (%) | 75.2 |
| Open Medical LLM - MMLU College Medicine | 65.32 | Accuracy (%) | 69.3 |
| Open PL LLM - Generative | 58.61 | Average Generative Score (%) | 68.2 |
| EuroEval Italian NLU - MultiNERD IT | 67.92 | Named entity recognition Score (%) | 67.7 |
| Enkrypt AI - Bias Risk | 78.81 | Risk Score | 66.9 |
| EuroEval Portuguese NLU - MultiWikiQA PT | 71.83 | Reading comprehension Score (%) | 66.2 |
| Open PL LLM - Multiple Choice | 48.68 | Average Multiple-Choice Score (%) | 66.1 |
| Open PL LLM Leaderboard | 54.18 | Average Score (%) | 66.1 |
| Open PL LLM - RAG | 65.15 | Average RAG Score (%) | 65.7 |
Interactive version: theaggregate.ai/model?slug=starling-lm-7b-beta · How It Works · Data refreshed daily, snapshot 2026-09-05.