starcoder2-3B — benchmark results
Provider: BigCode. Released 2024-02-28. Access: Open.
Unified ELO 1155 ± 22, rank #1731 of 1776 rated models, from 25 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| EffiBench - NET | 2.9 | Normalized Execution Time | 70.7 |
| BigCode Models Leaderboard | 31.4 | HumanEval Python Pass@1 (%) | 25.4 |
| ShaderMatch | 7.36 | Clone Match Rate (%) | 23.8 |
| GSM8K | 21.6 | Accuracy (%) | 23.4 |
| CRUXEval | 34.2 | Output Prediction pass@1 (%) | 21.4 |
| Open LLM Leaderboard - BBH | 8.91 | Score | 18.7 |
| EvoEval Concise | 33.54 | Pass@1 (%) | 18 |
| EffiBench - NMU | 1.94 | Normalized Memory Usage | 17.1 |
| Open LLM Leaderboard - MMLU-Pro | 7.07 | Score | 17.1 |
| EvoEval Creative | 14 | Pass@1 (%) | 17 |
| EvalPlus (HumanEval+ & MBPP+) | 27.4 | Pass@1 avg (%) | 15.7 |
| Open LLM Leaderboard - IFEval | 20.37 | Score | 12.4 |
Interactive version: theaggregate.ai/model?slug=starcoder2-3b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.