deepseek-llm-67B-base — benchmark results

DeepSeek LLM 67B base checkpoint. Provider: DeepSeek. Released 2023-11-29. Access: Open.

Unified ELO 1440 ± 18, rank #1041 of 1776 rated models, from 10 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - HellaSwag72.83Accuracy (%)96.7
Open Chinese LLM - ARC Challenge61.86Accuracy (%)91.4
Open Chinese LLM - WinoGrande69.06Accuracy (%)89
Open Chinese LLM Leaderboard64.38Average Score (%)79.2
Open Chinese LLM - CMMLU66.86Accuracy (%)77.4
Open Chinese LLM - C-Eval Semantic81.81Accuracy (%)70.9
Open Chinese LLM - GSM8K48.67Accuracy (%)62.6
InfiBench39.87Score (%)54.3
Science Leaderboard39.4Average Accuracy (%)42.4
Open Chinese LLM - TruthfulQA MC49.6Accuracy (%)17.2

Interactive version: theaggregate.ai/model?slug=deepseek-llm-67b-base · How the rankings work · Data refreshed daily, snapshot 2026-07-22.