deepseek-llm-67B-chat — benchmark results

DeepSeek's first-gen 67B chat model, instruction-tuned from a base trained on 2T English/Chinese tokens; open weights allowing commercial use. Provider: DeepSeek. Released 2023-11-29. Access: Open.

Unified ELO 1448 ± 45, rank #1008 of 1776 rated models, from 12 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MuSR23.93Score98.7
ChineseSafe Benchmark76.76Accuracy (%)98.1
InfiBench57.41Score (%)89.5
Open LLM Leaderboard - GPQA8.84Score72.5
Open LLM Leaderboard - MMLU-Pro32.71Score72.3
Open LLM Leaderboard - IFEval55.87Score67.7
Open LLM Leaderboard - BBH33.23Score64.9
BenchBench57.35Aggregate Score (%)60.3
AlpacaEval 2.017.84LC Win Rate (%)45.9
Open LLM Leaderboard - MATH Level 59.29Score45.1
Chatbot Arena (Text)1184Elo16.6
MATH Level 56.39Accuracy (%)4.6

Interactive version: theaggregate.ai/model?slug=deepseek-llm-67b-chat · How the rankings work · Data refreshed daily, snapshot 2026-07-22.