DeepSeek Reasoner: benchmark results

DeepSeek's deepseek-reasoner API endpoint row, the thinking mode of the current DeepSeek flagship. Provider: DeepSeek. Released 2025-01-20. Access: API.

Unified ELO 1636 ± 1, rank #159 of 1392 rated models, from 53 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Nejumi 4 - ALT - Bias95.46Score (%)93.4
Nejumi 4 - ALT - Toxicity85.09Score (%)86.9
Nejumi 4 - ALT Average88.66Score (%)83.6
BIRD-CRITIC33.67Score80
Nejumi 4 - GLP - Expression98Score (%)77.5
OTIS Mock AIME 2024-2587.82Accuracy (%)76
Nejumi 4 - ALT - Truthfulness80.97Score (%)75.4
IslamicTurathBench77.63IslamicTurathBench Score (%)75
Xent Games62.67Overall Score (self-reported)72.7
Mizan LLM Leaderboard65.5Average Score (0-100)70.5
Nejumi 4 - GLP - Mathematical Reasoning95.5Score (%)69.3
gg-bench22.27Games Won66.7

Interactive version: theaggregate.ai/model?slug=deepseek-reasoner · How It Works · Data refreshed daily, snapshot 2026-09-05.