DeepSeek-Math-7B-RL: benchmark results

Provider: DeepSeek. Access: Open.

Unified ELO 1376 ± 22, rank #2307 of 2928 rated models, from 10 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
MathBench50.3Average Score63.6
Open LLM Leaderboard v1 - MMLU56.81Accuracy (%) (5-shot)40
Open LLM Leaderboard v1 - ARC Challenge55.46Normalized accuracy (%) (25-shot)33.5
Open LLM Leaderboard v1 - GSM8K5.38Accuracy (%) (5-shot)24.1
Open LLM Leaderboard v1 - HellaSwag72.45Normalized accuracy (%) (10-shot)22.9
Open LLM Leaderboard v1 - WinoGrande66.77Accuracy (%) (5-shot)20.7
Open LLM Leaderboard v1 - TruthfulQA MC240.37MC2 (%) (0-shot)13.8
MATH-Perturb (Hard)13.62Accuracy (%)11.1
Omni-MATH16.12Overall Accuracy (%)7.1
PhysicsFinals0.4Score (self-reported)0

Interactive version: theaggregate.ai/model?slug=deepseek-math-7b-rl · How It Works · Data refreshed daily, snapshot 2026-09-23.