DeepSeek R1 Zero: benchmark results

Provider: DeepSeek. Released 2025-01-20. Access: Open.

Unified ELO 1730 ± 40, rank #273 of 2656 rated models, from 12 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
BenchTable - STEM80.9Weighted Score (%)93
SpeechMap Compliance91.6% Requests Completed93
BenchTable70.5Total Score (%)87.1
SuperGPQA60.24Accuracy (%)86
BenchTable - Reasoning66.7Weighted Score (%)81.8
LLM Stats (AIME 2024)86.7Score (%)74.5
BenchTable - Tech61.8Weighted Score (%)60.2
BenchTable - Utility53.6Weighted Score (%)50.9
ZeroEval GPQA Diamond73.3GPQA Diamond Score48.4
ZeroEval MATH-50095.9MATH-500 Score46.9
LLM Stats Score16LLM Stats Score (conservative rating)38.3
Reward Hacking Benchmark (RHB)13.9Exploit rate (%) (self-reported)0

Interactive version: theaggregate.ai/model?slug=deepseek-r1-zero · How It Works · Data refreshed daily, snapshot 2026-09-19.