deepseek-llm-67B-chat: benchmark results
DeepSeek's first-gen 67B chat model, instruction-tuned from a base trained on 2T English/Chinese tokens; open weights allowing commercial use. Provider: DeepSeek. Released 2023-11-29. Access: Open.
Unified ELO 1481 ± 1, rank #783 of 1392 rated models, from 28 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - MuSR | 23.93 | Score | 98.7 |
| ChineseSafe Benchmark | 76.76 | Accuracy (%) | 98.1 |
| Open LLM Leaderboard - GPQA | 8.84 | Score | 72.5 |
| Open LLM Leaderboard - MMLU-Pro | 32.71 | Score | 72.3 |
| Open LLM Leaderboard - IFEval | 55.87 | Score | 67.7 |
| Open LLM Leaderboard - BBH | 33.23 | Score | 64.9 |
| Enkrypt AI - Insecure Code Risk | 21.78 | Risk Score | 61.7 |
| BenchBench | 57.35 | Aggregate Score (%) | 60.3 |
| Enkrypt AI - Safety Risk | 26.01 | Risk Score | 50.8 |
| AlpacaEval 2.0 | 17.84 | LC Win Rate (%) | 45.9 |
| Open LLM Leaderboard - MATH Level 5 | 9.29 | Score | 45.1 |
| Enkrypt AI - Risk Score | 39.45 | Risk Score | 26.9 |
Interactive version: theaggregate.ai/model?slug=deepseek-llm-67b-chat · How It Works · Data refreshed daily, snapshot 2026-09-05.