DeepSeek V3P2 (Thinking): benchmark results

Provider: DeepSeek. Released 2025-12-01. Access: Open.

Unified ELO 1618 ± 1, rank #514 of 3078 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Poker Agent1090.3TrueSkill (self-reported)81.2
MedQA93.92Score (%)79.8
MMLU Pro84.92Score (%)60.5
AIME84.58Score (%)60
GPQA Diamond80.3Score (%)55.6
IOI10.67Score (self-reported)45
Vals AI CaseLaw v255.41Accuracy (%)36.4
TaxEval v268.15Score (%)32.1
LegalBench76.08Score (%)27.3
CorpFin v250.97Score (%)21.6
Vals AI MGSM86.04Accuracy (%)16.7
Vibe Code Bench v1.15.11Score (%)12.2

Interactive version: theaggregate.ai/model?slug=deepseek-v3p2-thinking · How It Works · Data refreshed daily, snapshot 2026-09-19.