DeepSeek V3.2 Exp — benchmark results

DeepSeek's experimental V3.2 release introducing DeepSeek Sparse Attention for cheaper long-context inference. Provider: DeepSeek. Released 2025-09-29. Access: Open.

Unified ELO 1680 ± 6, rank #307 of 1776 rated models, from 341 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AGC-Bench - tinystories1.64Dataset z-score97.6
Evals for Every Language - Language vai25Average Score (%)96.6
AGC-Bench - hypogen1.51Dataset z-score93.9
AGC-Bench - pron_vs_prompt1.07Dataset z-score93.8
AA-LCR69Score (self-reported)92.7
AGC-Bench - poetmt1.26Dataset z-score92.6
AGC-Bench - analobench0.83Dataset z-score91.4
AGC-Bench - chinese_homophonic_puns1.19Dataset z-score91.4
Evals for Every Language - Language kmb33.25Average Score (%)89.7
Evals for Every Language - Language ff68.25Average Score (%)89.2
AGC-Bench - historical_analogy1.38Dataset z-score88.8
Step Game (Lechmazur)3.67TrueSkill μ87.8

Interactive version: theaggregate.ai/model?slug=deepseek-v3-2-exp · How the rankings work · Data refreshed daily, snapshot 2026-07-22.