deepseek-coder-33B-base — benchmark results
Provider: DeepSeek. Released 2023-10-28. Access: Open.
Unified ELO 1277 ± 27, rank #1579 of 1776 rated models, from 11 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| SAFIM | 69.01 | Average | 100 |
| BigCode Models Leaderboard | 52.5 | HumanEval Python Pass@1 (%) | 66.1 |
| InfiBench | 38.75 | Score (%) | 52.4 |
| GSM8K | 35.4 | Accuracy (%) | 39.9 |
| EvalPlus (HumanEval+ & MBPP+) | 44.5 | Pass@1 avg (%) | 37.1 |
| EffiBench - NET | 3.14 | Normalized Execution Time | 26.8 |
| ARC Challenge (AI2) | 42.2 | Accuracy (%) | 25.6 |
| WinoGrande | 62 | Accuracy (%) | 16.2 |
| MMLU | 39.4 | Accuracy (%) | 11.9 |
| Epoch AI - ECI | 95.86 | ECI Score | 3 |
| EffiBench - NMU | 2.08 | Normalized Memory Usage | 0 |
Interactive version: theaggregate.ai/model?slug=deepseek-coder-33b-base · How the rankings work · Data refreshed daily, snapshot 2026-07-22.