DeepSeek R1 Distill Qwen 32B: benchmark results

DeepSeek's official R1 reasoning distill onto Qwen2.5-32B (MIT license), SFT-trained on ~800K R1-generated reasoning traces. Provider: DeepSeek. Released 2025-01-20. Access: Open.

Unified ELO 1493 ± 1, rank #721 of 1392 rated models, from 410 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
MERA - PARus96.2Accuracy (%)100
Open CoT - LogiQA 219.02CoT Gain (%)100
Open CoT Leaderboard16.92Average CoT Gain (%)99.2
Thai LLM - Extraction7.85Rating (0-10)98.6
Open CoT - LSAT Analytical Reasoning16.52CoT Gain (%)98.5
French LLM Leaderboard - GPQA FR54.4Score (%)98.1
Open CoT - LogiQA10.06CoT Gain (%)94.7
French LLM Leaderboard - Average53.39Average Score (%)94.4
French LLM Leaderboard - BAC FR45.62Score (%)94.4
Open CoT - LSAT Logical Reasoning20.39CoT Gain (%)93.9
Open Japanese LLM - Wiki NER SET F114.16Score (%)93.1
Thai LLM - Reasoning6.8Rating (0-10)92.3

Interactive version: theaggregate.ai/model?slug=deepseek-r1-distill-qwen-32b · How It Works · Data refreshed daily, snapshot 2026-09-05.