DeepSeek V3.2 Exp: benchmark results
DeepSeek's experimental V3.2 release introducing DeepSeek Sparse Attention for cheaper long-context inference. Provider: DeepSeek. Released 2025-09-29. Access: Open.
Unified ELO 1620 ± 1, rank #205 of 1392 rated models, from 368 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AGC-Bench - tinystories | 1.64 | Dataset z-score | 97.6 |
| Evals for Every Language - Language vai | 25 | Average Score (%) | 96.6 |
| AGC-Bench - hypogen | 1.51 | Dataset z-score | 93.9 |
| AGC-Bench - pron_vs_prompt | 1.07 | Dataset z-score | 93.8 |
| AGC-Bench - poetmt | 1.26 | Dataset z-score | 92.6 |
| AGC-Bench - analobench | 0.83 | Dataset z-score | 91.4 |
| AGC-Bench - chinese_homophonic_puns | 1.19 | Dataset z-score | 91.4 |
| Evals for Every Language - Language kmb | 33.25 | Average Score (%) | 89.7 |
| Evals for Every Language - Language ff | 68.25 | Average Score (%) | 89.2 |
| AGC-Bench - historical_analogy | 1.38 | Dataset z-score | 88.8 |
| Step Game (Lechmazur) | 3.67 | TrueSkill μ | 87.8 |
| Evals for Every Language - Language ca | 72.77 | Average Score (%) | 87 |
Interactive version: theaggregate.ai/model?slug=deepseek-v3-2-exp · How It Works · Data refreshed daily, snapshot 2026-09-05.