Starling-LM-7B-beta-ExPO: benchmark results

Provider: UC Berkeley. Released 2024-04-26. Access: Open.

Unified ELO 1446 ± 1, rank #962 of 1392 rated models, from 10 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - TruthfulQA MC55.58Accuracy (%)63.8
AlpacaEval 2.026.41LC Win Rate (%)63.1
Open Chinese LLM - GSM8K42.68Accuracy (%)43.6
WildBench31.56WB Score Task-Macro37.1
Open Chinese LLM - CMMLU48.86Accuracy (%)30.6
Open Chinese LLM Leaderboard52.98Average Score (%)28.2
Open Chinese LLM - C-Eval Semantic62.08Accuracy (%)27.7
Open Chinese LLM - ARC Challenge46.76Accuracy (%)24.6
Open Chinese LLM - WinoGrande60.85Accuracy (%)20.3
Open Chinese LLM - HellaSwag54.02Accuracy (%)17.8

Interactive version: theaggregate.ai/model?slug=starling-lm-7b-beta-expo · How It Works · Data refreshed daily, snapshot 2026-09-05.