DeepSeek V3.2 Exp — benchmark results
DeepSeek's experimental V3.2 release introducing DeepSeek Sparse Attention for cheaper long-context inference. Provider: DeepSeek. Released 2025-09-29. Access: Open.
Unified ELO 1680 ± 6, rank #307 of 1776 rated models, from 341 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AGC-Bench - tinystories | 1.64 | Dataset z-score | 97.6 |
| Evals for Every Language - Language vai | 25 | Average Score (%) | 96.6 |
| AGC-Bench - hypogen | 1.51 | Dataset z-score | 93.9 |
| AGC-Bench - pron_vs_prompt | 1.07 | Dataset z-score | 93.8 |
| AA-LCR | 69 | Score (self-reported) | 92.7 |
| AGC-Bench - poetmt | 1.26 | Dataset z-score | 92.6 |
| AGC-Bench - analobench | 0.83 | Dataset z-score | 91.4 |
| AGC-Bench - chinese_homophonic_puns | 1.19 | Dataset z-score | 91.4 |
| Evals for Every Language - Language kmb | 33.25 | Average Score (%) | 89.7 |
| Evals for Every Language - Language ff | 68.25 | Average Score (%) | 89.2 |
| AGC-Bench - historical_analogy | 1.38 | Dataset z-score | 88.8 |
| Step Game (Lechmazur) | 3.67 | TrueSkill μ | 87.8 |
Interactive version: theaggregate.ai/model?slug=deepseek-v3-2-exp · How the rankings work · Data refreshed daily, snapshot 2026-07-22.