DeepSeek R1: benchmark results

DeepSeek's open R1 reasoning model trained with large-scale RL (January 2025). Provider: DeepSeek. Released 2025-01-20. Access: Open.

Unified ELO 1577 ± 1, rank #329 of 1392 rated models, from 429 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
CRMArena - KQA61.2KQA Score (%)100
Enhancing Agent Safety Judgment94.53Original (Seed) (self-reported)100
Fibble3 Arena33.33Win Rate (%)100
HELM MedHELM - Patient Communication71.88Mean win rate100
HELM MedHELM - Race-Based Medicine91.62EM100
LexGenius64.59CoT average (self-reported)100
MedHELM66.25Mean Win Rate (self-reported)100
RepoReasoner0.69Pass@1 (0-1)100
SEAL - Fortress74.39Score100
TACTL95.9Accuracy (%)100
VinCLAT (Catalan)28.25Average Accuracy (%)100
TuRTLe - Icarus Syntax95.22Average Score (%)97.7

Interactive version: theaggregate.ai/model?slug=deepseek-r1 · How It Works · Data refreshed daily, snapshot 2026-09-05.