DeepSeek V3.2: benchmark results
DeepSeek's open V3.2, a 671B sparse MoE (37B active) continuing the V3 line's sparse-attention efficiency (December 2025). Provider: DeepSeek. Released 2025-12-01. Access: Open.
Unified ELO 1622 ± 1, rank #197 of 1392 rated models, from 482 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AJ-Bench | 77.34 | Overall Avg@3 (%) | 100 |
| Chinese Classical Bench - Compress Efficiency | 16.32 | Score (%) | 100 |
| LegalBench-RU - Reasoning | 91 | Accuracy (%) | 100 |
| AGC-Bench - slang_generation | 1.26 | Dataset z-score | 98.8 |
| WebArena | 74.3 | Success Rate (%) | 97.8 |
| RAI-Bench - Refusal Rate (General) | 84 | Rate (%) | 96.2 |
| Nejumi 4 - ALT - Bias | 96.57 | Score (%) | 95.9 |
| GR-Ben | 55.4 | Average (self-reported) | 95.2 |
| AGC-Bench - scar | 0.97 | Dataset z-score | 95.1 |
| Chinese Classical Bench - Idiom-Source Book EM | 74 | Score (%) | 94.4 |
| LLM Arena RU | 1133 | Arena Elo | 94.2 |
| RewardBench 2 Focus | 92.63 | Accuracy (%) | 94.1 |
Interactive version: theaggregate.ai/model?slug=deepseek-v3-2 · How It Works · Data refreshed daily, snapshot 2026-09-05.