deepseek-llm-67B-chat: benchmark results

DeepSeek's first-gen 67B chat model, instruction-tuned from a base trained on 2T English/Chinese tokens; open weights allowing commercial use. Provider: DeepSeek. Released 2023-11-29. Access: Open.

Unified ELO 1481 ± 1, rank #783 of 1392 rated models, from 28 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MuSR23.93Score98.7
ChineseSafe Benchmark76.76Accuracy (%)98.1
Open LLM Leaderboard - GPQA8.84Score72.5
Open LLM Leaderboard - MMLU-Pro32.71Score72.3
Open LLM Leaderboard - IFEval55.87Score67.7
Open LLM Leaderboard - BBH33.23Score64.9
Enkrypt AI - Insecure Code Risk21.78Risk Score61.7
BenchBench57.35Aggregate Score (%)60.3
Enkrypt AI - Safety Risk26.01Risk Score50.8
AlpacaEval 2.017.84LC Win Rate (%)45.9
Open LLM Leaderboard - MATH Level 59.29Score45.1
Enkrypt AI - Risk Score39.45Risk Score26.9

Interactive version: theaggregate.ai/model?slug=deepseek-llm-67b-chat · How It Works · Data refreshed daily, snapshot 2026-09-05.