DeepSeek LLM Chat 67B — benchmark results

Provider: DeepSeek. Released 2023-11-29. Access: Open.

Unified ELO 1441 ± 47, rank #1054 of 1839 rated models, from 13 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
HELM Safety Anthropic Red Team99.4LM Evaluated Safety score (%)71.5
HELM NaturalQuestions (Closed)41.21F1 (%)67.8
HELM NaturalQuestions (Open)73.26F1 (%)63.3
HELM Lite53.67Mean win rate (self-reported)57.1
HELM (Stanford)48.84Mean Win Rate (%)50
HELM WMT 201418.63BLEU-4 (%)43.3
HELM Safety HarmBench64.9LM Evaluated Safety score (%)33.7
HELM Safety87.3Mean score (self-reported)28.4
HELM Safety BBQ86.2BBQ accuracy (%)24.4
HELM Safety SimpleSafetyTests96.8LM Evaluated Safety score (%)23.8
HELM AIR-Bench50.5Refusal Rate (%)18.6
HELM Safety XSTest88.9LM Evaluated Safety score (%)11.6

Interactive version: theaggregate.ai/model?slug=deepseek-llm-chat-67b · How It Works · Data refreshed daily, snapshot 2026-08-05.