DeepSeek Reasoner: benchmark results
DeepSeek's deepseek-reasoner API endpoint row, the thinking mode of the current DeepSeek flagship. Provider: DeepSeek. Released 2025-01-20. Access: API.
Unified ELO 1636 ± 1, rank #159 of 1392 rated models, from 53 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Nejumi 4 - ALT - Bias | 95.46 | Score (%) | 93.4 |
| Nejumi 4 - ALT - Toxicity | 85.09 | Score (%) | 86.9 |
| Nejumi 4 - ALT Average | 88.66 | Score (%) | 83.6 |
| BIRD-CRITIC | 33.67 | Score | 80 |
| Nejumi 4 - GLP - Expression | 98 | Score (%) | 77.5 |
| OTIS Mock AIME 2024-25 | 87.82 | Accuracy (%) | 76 |
| Nejumi 4 - ALT - Truthfulness | 80.97 | Score (%) | 75.4 |
| IslamicTurathBench | 77.63 | IslamicTurathBench Score (%) | 75 |
| Xent Games | 62.67 | Overall Score (self-reported) | 72.7 |
| Mizan LLM Leaderboard | 65.5 | Average Score (0-100) | 70.5 |
| Nejumi 4 - GLP - Mathematical Reasoning | 95.5 | Score (%) | 69.3 |
| gg-bench | 22.27 | Games Won | 66.7 |
Interactive version: theaggregate.ai/model?slug=deepseek-reasoner · How It Works · Data refreshed daily, snapshot 2026-09-05.