Stable-Code 3B: benchmark results

Provider: Other. Access: Open.

Unified ELO 1283 ± 19, rank #2745 of 2928 rated models, from 19 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - GSM8K19.56Accuracy (%) (5-shot)40.7
ShaderMatch9.64Clone Match Rate (%)28.6
EvalPlus (HumanEval+ & MBPP+)35.7Pass@1 avg (%)25
EvoEval Tool Use41Pass@1 (%)24
BigCode Models Leaderboard30.7HumanEval Python Pass@1 (%)22
Open LLM Leaderboard v1 - MMLU37.53Accuracy (%) (5-shot)19.3
EvoEval Combine3Pass@1 (%)19
Open LLM Leaderboard v1 - TruthfulQA MC241.6MC2 (%) (0-shot)17.6
EvoEval Difficult10Pass@1 (%)17
Open LLM Leaderboard v1 - ARC Challenge35.32Normalized accuracy (%) (25-shot)13.1
EvoEval Concise31.1Pass@1 (%)13
Open LLM Leaderboard v1 - HellaSwag57.45Normalized accuracy (%) (10-shot)13

Interactive version: theaggregate.ai/model?slug=stable-code-3b · How It Works · Data refreshed daily, snapshot 2026-09-23.