deepseek-llm-7B-chat: benchmark results

DeepSeek LLM 7B chat checkpoint. Provider: DeepSeek. Released 2023-11-29. Access: Open.

Unified ELO 1409 ± 1, rank #1100 of 1392 rated models, from 17 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MuSR19.21Score93
ChineseSafe Benchmark71.63Accuracy (%)79.6
Open Chinese LLM - HellaSwag62.57Accuracy (%)67.7
Open Chinese LLM - WinoGrande64.17Accuracy (%)65
Open LLM Leaderboard - IFEval41.71Score42.5
Open Chinese LLM - ARC Challenge49.66Accuracy (%)40.2
Open Chinese LLM - TruthfulQA MC51.61Accuracy (%)29.8
MedCTA11Outcome Accuracy (self-reported)29.4
Open Chinese LLM - GSM8K31.54Accuracy (%)25.5
Open Chinese LLM Leaderboard51.57Average Score (%)24
Open LLM Leaderboard - MMLU-Pro12.59Score22.4
Open LLM Leaderboard - BBH11.26Score20.8

Interactive version: theaggregate.ai/model?slug=deepseek-llm-7b-chat · How It Works · Data refreshed daily, snapshot 2026-09-05.