DeepSeek V3P2 (Thinking): benchmark results
Provider: DeepSeek. Released 2025-12-01. Access: Open.
Unified ELO 1618 ± 1, rank #514 of 3078 rated models, from 14 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Poker Agent | 1090.3 | TrueSkill (self-reported) | 81.2 |
| MedQA | 93.92 | Score (%) | 79.8 |
| MMLU Pro | 84.92 | Score (%) | 60.5 |
| AIME | 84.58 | Score (%) | 60 |
| GPQA Diamond | 80.3 | Score (%) | 55.6 |
| IOI | 10.67 | Score (self-reported) | 45 |
| Vals AI CaseLaw v2 | 55.41 | Accuracy (%) | 36.4 |
| TaxEval v2 | 68.15 | Score (%) | 32.1 |
| LegalBench | 76.08 | Score (%) | 27.3 |
| CorpFin v2 | 50.97 | Score (%) | 21.6 |
| Vals AI MGSM | 86.04 | Accuracy (%) | 16.7 |
| Vibe Code Bench v1.1 | 5.11 | Score (%) | 12.2 |
Interactive version: theaggregate.ai/model?slug=deepseek-v3p2-thinking · How It Works · Data refreshed daily, snapshot 2026-09-19.