stablelm-2-12B-chat — benchmark results

Stability AI's 12B instruction-tuned chat model (April 2024), trained on 2T tokens in seven languages; free for non-commercial use, commercial via membership. Provider: Stability AI. Released 2024-04-04. Access: Open.

Unified ELO 1417 ± 33, rank #1144 of 1776 rated models, from 12 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
RewardBench Chat96.65Accuracy (%)77.8
RewardBench76.42Score (%)71.6
RewardBench Reasoning89.45Accuracy (%)70.4
Open LLM Leaderboard - IFEval40.82Score41.2
RewardBench Safety78.11Accuracy (%)39.7
Open LLM Leaderboard - BBH25.25Score38.6
Open LLM Leaderboard - MuSR7.73Score36
RewardBench Chat Hard55.48Accuracy (%)34.7
Open LLM Leaderboard - MATH Level 55.36Score29.8
Open LLM Leaderboard - MMLU-Pro19.27Score29.5
Open LLM Leaderboard - GPQA2.24Score21.2
RewardBench Prior Sets (0.5 weight)48.39Score (%)17.3

Interactive version: theaggregate.ai/model?slug=stablelm-2-12b-chat · How the rankings work · Data refreshed daily, snapshot 2026-07-22.