starcoder2-3B — benchmark results

Provider: BigCode. Released 2024-02-28. Access: Open.

Unified ELO 1155 ± 22, rank #1731 of 1776 rated models, from 25 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
EffiBench - NET2.9Normalized Execution Time70.7
BigCode Models Leaderboard31.4HumanEval Python Pass@1 (%)25.4
ShaderMatch7.36Clone Match Rate (%)23.8
GSM8K21.6Accuracy (%)23.4
CRUXEval34.2Output Prediction pass@1 (%)21.4
Open LLM Leaderboard - BBH8.91Score18.7
EvoEval Concise33.54Pass@1 (%)18
EffiBench - NMU1.94Normalized Memory Usage17.1
Open LLM Leaderboard - MMLU-Pro7.07Score17.1
EvoEval Creative14Pass@1 (%)17
EvalPlus (HumanEval+ & MBPP+)27.4Pass@1 avg (%)15.7
Open LLM Leaderboard - IFEval20.37Score12.4

Interactive version: theaggregate.ai/model?slug=starcoder2-3b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.