DeepSeek-Math-7B-RL: benchmark results
Provider: DeepSeek. Access: Open.
Unified ELO 1376 ± 22, rank #2307 of 2928 rated models, from 10 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| MathBench | 50.3 | Average Score | 63.6 |
| Open LLM Leaderboard v1 - MMLU | 56.81 | Accuracy (%) (5-shot) | 40 |
| Open LLM Leaderboard v1 - ARC Challenge | 55.46 | Normalized accuracy (%) (25-shot) | 33.5 |
| Open LLM Leaderboard v1 - GSM8K | 5.38 | Accuracy (%) (5-shot) | 24.1 |
| Open LLM Leaderboard v1 - HellaSwag | 72.45 | Normalized accuracy (%) (10-shot) | 22.9 |
| Open LLM Leaderboard v1 - WinoGrande | 66.77 | Accuracy (%) (5-shot) | 20.7 |
| Open LLM Leaderboard v1 - TruthfulQA MC2 | 40.37 | MC2 (%) (0-shot) | 13.8 |
| MATH-Perturb (Hard) | 13.62 | Accuracy (%) | 11.1 |
| Omni-MATH | 16.12 | Overall Accuracy (%) | 7.1 |
| PhysicsFinals | 0.4 | Score (self-reported) | 0 |
Interactive version: theaggregate.ai/model?slug=deepseek-math-7b-rl · How It Works · Data refreshed daily, snapshot 2026-09-23.