DeepSeek V3.2 Exp: benchmark results

DeepSeek's experimental V3.2 release introducing DeepSeek Sparse Attention for cheaper long-context inference. Provider: DeepSeek. Released 2025-09-29. Access: Open.

Unified ELO 1620 ± 1, rank #205 of 1392 rated models, from 368 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AGC-Bench - tinystories1.64Dataset z-score97.6
Evals for Every Language - Language vai25Average Score (%)96.6
AGC-Bench - hypogen1.51Dataset z-score93.9
AGC-Bench - pron_vs_prompt1.07Dataset z-score93.8
AGC-Bench - poetmt1.26Dataset z-score92.6
AGC-Bench - analobench0.83Dataset z-score91.4
AGC-Bench - chinese_homophonic_puns1.19Dataset z-score91.4
Evals for Every Language - Language kmb33.25Average Score (%)89.7
Evals for Every Language - Language ff68.25Average Score (%)89.2
AGC-Bench - historical_analogy1.38Dataset z-score88.8
Step Game (Lechmazur)3.67TrueSkill μ87.8
Evals for Every Language - Language ca72.77Average Score (%)87

Interactive version: theaggregate.ai/model?slug=deepseek-v3-2-exp · How It Works · Data refreshed daily, snapshot 2026-09-05.