DeepSeek V3.2 — benchmark results
DeepSeek V3.2 model row. Provider: DeepSeek. Released 2025-12-01. Access: Open.
Unified ELO 1660 ± 10, rank #345 of 1776 rated models, from 410 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AJ-Bench | 77.34 | Overall Avg@3 (%) | 100 |
| ASPI | 65.4 | ASR exec_tool (self-reported) | 100 |
| Chinese Classical Bench - Compress Efficiency | 16.32 | Score (%) | 100 |
| LITMUS | 71.51 | Attack Success Rate (self-reported) | 100 |
| AGC-Bench - slang_generation | 1.26 | Dataset z-score | 98.8 |
| WebArena | 74.3 | Success Rate (%) | 97.8 |
| OpenEvals - Humanity's Last Exam | 40.8 | Accuracy (%) | 96.4 |
| GR-Ben | 55.4 | Average (self-reported) | 95.2 |
| AGC-Bench - scar | 0.97 | Dataset z-score | 95.1 |
| LLM Arena RU | 1133 | Arena Elo | 94.5 |
| Chinese Classical Bench - Idiom-Source Book EM | 74 | Score (%) | 94.4 |
| RewardBench 2 Focus | 92.63 | Accuracy (%) | 94.1 |
Interactive version: theaggregate.ai/model?slug=deepseek-v3-2 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.