Starling-LM-7B-beta-ExPO — benchmark results

Provider: UC Berkeley. Released 2024-04-26. Access: Open.

Unified ELO 1385 ± 11, rank #1286 of 1776 rated models, from 10 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - TruthfulQA MC55.58Accuracy (%)63.8
AlpacaEval 2.026.41LC Win Rate (%)63.1
Open Chinese LLM - GSM8K42.68Accuracy (%)43.6
WildBench31.56WB Score Task-Macro37.1
Open Chinese LLM - CMMLU48.86Accuracy (%)30.6
Open Chinese LLM Leaderboard52.98Average Score (%)28.2
Open Chinese LLM - C-Eval Semantic62.08Accuracy (%)27.7
Open Chinese LLM - ARC Challenge46.76Accuracy (%)24.6
Open Chinese LLM - WinoGrande60.85Accuracy (%)20.3
Open Chinese LLM - HellaSwag54.02Accuracy (%)17.8

Interactive version: theaggregate.ai/model?slug=starling-lm-7b-beta-expo · How the rankings work · Data refreshed daily, snapshot 2026-07-22.