stablelm-2-zephyr-1.6B — benchmark results

Provider: Stability AI. Released 2024-01-19. Access: Open.

Unified ELO 1316 ± 45, rank #1502 of 1776 rated models, from 12 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
RewardBench Chat96.65Accuracy (%)77.8
RewardBench65.74Score (%)41.4
Open LLM Leaderboard - IFEval32.79Score30.7
Open LLM Leaderboard - MuSR5.99Score28.8
RewardBench Chat Hard46.71Accuracy (%)21.6
RewardBench Reasoning67.84Accuracy (%)21.3
Open LLM Leaderboard - MATH Level 53.32Score20.2
Open LLM Leaderboard - MMLU-Pro7.93Score18.3
RewardBench Prior Sets (0.5 weight)48.68Score (%)18.3
Open LLM Leaderboard - BBH6.71Score14.1
RewardBench Safety60.27Accuracy (%)12.7
Open LLM Leaderboard - GPQA0Score2.6

Interactive version: theaggregate.ai/model?slug=stablelm-2-zephyr-1-6b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.