Starling-LM-7B-beta-ExPO — benchmark results
Provider: UC Berkeley. Released 2024-04-26. Access: Open.
Unified ELO 1385 ± 11, rank #1286 of 1776 rated models, from 10 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open Chinese LLM - TruthfulQA MC | 55.58 | Accuracy (%) | 63.8 |
| AlpacaEval 2.0 | 26.41 | LC Win Rate (%) | 63.1 |
| Open Chinese LLM - GSM8K | 42.68 | Accuracy (%) | 43.6 |
| WildBench | 31.56 | WB Score Task-Macro | 37.1 |
| Open Chinese LLM - CMMLU | 48.86 | Accuracy (%) | 30.6 |
| Open Chinese LLM Leaderboard | 52.98 | Average Score (%) | 28.2 |
| Open Chinese LLM - C-Eval Semantic | 62.08 | Accuracy (%) | 27.7 |
| Open Chinese LLM - ARC Challenge | 46.76 | Accuracy (%) | 24.6 |
| Open Chinese LLM - WinoGrande | 60.85 | Accuracy (%) | 20.3 |
| Open Chinese LLM - HellaSwag | 54.02 | Accuracy (%) | 17.8 |
Interactive version: theaggregate.ai/model?slug=starling-lm-7b-beta-expo · How the rankings work · Data refreshed daily, snapshot 2026-07-22.