DeepSeek V3.2 Exp (Thinking): benchmark results

DeepSeek V3.2 Exp evaluated with thinking enabled. Provider: DeepSeek. Released 2025-09-29. Access: Open.

Unified ELO 1608 ± 1, rank #395 of 1761 rated models, from 87 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
UGI Leaderboard53.84UGI Score95.4
AA Omniscience - Software Engineering (SWE) - Swift56Accuracy (%)91.5
UGI - Writing54Writing Score90.3
AA MMLU-Pro85.04Accuracy (%)89.8
AA LiveCodeBench78.94Pass@1 (%)89.2
UGI - Natural Intelligence46.34NatInt Score88.7
Gorilla API Bench (BFCL)56.73Overall Accuracy (%)86.6
AA AIME 202587.67Accuracy (%)85.1
AA Global-MMLU-Lite - German91.08Accuracy (%)82.9
AA Global-MMLU-Lite - French91.08Accuracy (%)82
AA Global-MMLU-Lite - Portuguese91Accuracy (%)81.5
AA Global-MMLU-Lite - English92.33Accuracy (%)80.6

Interactive version: theaggregate.ai/model?slug=deepseek-v3-2-exp-thinking · How It Works · Data refreshed daily, snapshot 2026-09-05.