stablelm-zephyr-3B — benchmark results

Provider: Stability AI. Released 2023-11-21. Access: Open.

Unified ELO 1210 ± 73, rank #1675 of 1776 rated models, from 25 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
RewardBench71.46Score (%)58
Open LLM Leaderboard - MuSR9.79Score48.1
RewardBench Chat Hard60.09Accuracy (%)46
EuroEval Portuguese NLU - ScaLA PT8.98Linguistic acceptability Score (%)43.2
EuroEval Portuguese NLU - MultiWikiQA PT65.92Reading comprehension Score (%)41.5
EuroEval Portuguese NLU - SST-2 PT72.76Sentiment classification Score (%)40.7
EuroEval Portuguese NLU45.29NLU Average Score (%)39.4
RewardBench Reasoning75.73Accuracy (%)37.9
Open LLM Leaderboard - IFEval36.83Score35.5
EuroEval Portuguese Common Sense Reasoning14.18Common Sense Reasoning Average Score (%)35.3
EuroEval Portuguese34.75Average Score (%)34.8
RewardBench Safety74.05Accuracy (%)30.6

Interactive version: theaggregate.ai/model?slug=stablelm-zephyr-3b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.