deepseek-llm-7B-chat — benchmark results

DeepSeek LLM 7B chat checkpoint. Provider: DeepSeek. Released 2023-11-29. Access: Open.

Unified ELO 1362 ± 24, rank #1372 of 1776 rated models, from 18 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MuSR19.21Score93
ChineseSafe Benchmark71.63Accuracy (%)79.6
Open Chinese LLM - HellaSwag62.57Accuracy (%)67.7
Open Chinese LLM - WinoGrande64.17Accuracy (%)65
InfiBench36.75Score (%)45.7
Open LLM Leaderboard - IFEval41.71Score42.5
Open Chinese LLM - ARC Challenge49.66Accuracy (%)40.2
Open Chinese LLM - TruthfulQA MC51.61Accuracy (%)29.8
MedCTA11Outcome Accuracy (self-reported)29.4
Open Chinese LLM - GSM8K31.54Accuracy (%)25.5
Open Chinese LLM Leaderboard51.57Average Score (%)24
Open LLM Leaderboard - MMLU-Pro12.59Score22.4

Interactive version: theaggregate.ai/model?slug=deepseek-llm-7b-chat · How the rankings work · Data refreshed daily, snapshot 2026-07-22.