DeepSeek R1: benchmark results
DeepSeek's open R1 reasoning model trained with large-scale RL (January 2025). Provider: DeepSeek. Released 2025-01-20. Access: Open.
Unified ELO 1577 ± 1, rank #329 of 1392 rated models, from 429 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| CRMArena - KQA | 61.2 | KQA Score (%) | 100 |
| Enhancing Agent Safety Judgment | 94.53 | Original (Seed) (self-reported) | 100 |
| Fibble3 Arena | 33.33 | Win Rate (%) | 100 |
| HELM MedHELM - Patient Communication | 71.88 | Mean win rate | 100 |
| HELM MedHELM - Race-Based Medicine | 91.62 | EM | 100 |
| LexGenius | 64.59 | CoT average (self-reported) | 100 |
| MedHELM | 66.25 | Mean Win Rate (self-reported) | 100 |
| RepoReasoner | 0.69 | Pass@1 (0-1) | 100 |
| SEAL - Fortress | 74.39 | Score | 100 |
| TACTL | 95.9 | Accuracy (%) | 100 |
| VinCLAT (Catalan) | 28.25 | Average Accuracy (%) | 100 |
| TuRTLe - Icarus Syntax | 95.22 | Average Score (%) | 97.7 |
Interactive version: theaggregate.ai/model?slug=deepseek-r1 · How It Works · Data refreshed daily, snapshot 2026-09-05.