DeepSeek V3.2 — benchmark results

DeepSeek V3.2 model row. Provider: DeepSeek. Released 2025-12-01. Access: Open.

Unified ELO 1660 ± 10, rank #345 of 1776 rated models, from 410 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AJ-Bench77.34Overall Avg@3 (%)100
ASPI65.4ASR exec_tool (self-reported)100
Chinese Classical Bench - Compress Efficiency16.32Score (%)100
LITMUS71.51Attack Success Rate (self-reported)100
AGC-Bench - slang_generation1.26Dataset z-score98.8
WebArena74.3Success Rate (%)97.8
OpenEvals - Humanity's Last Exam40.8Accuracy (%)96.4
GR-Ben55.4Average (self-reported)95.2
AGC-Bench - scar0.97Dataset z-score95.1
LLM Arena RU1133Arena Elo94.5
Chinese Classical Bench - Idiom-Source Book EM74Score (%)94.4
RewardBench 2 Focus92.63Accuracy (%)94.1

Interactive version: theaggregate.ai/model?slug=deepseek-v3-2 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.