DeepSeek V3.2 Exp (Thinking) — benchmark results

DeepSeek V3.2 Exp evaluated with thinking enabled. Provider: DeepSeek. Released 2025-09-29. Access: Open.

Unified ELO 1692 ± 21, rank #286 of 1776 rated models, from 70 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
UGI Leaderboard53.84UGI Score95.5
AA LiveCodeBench78.94Pass@1 (%)91.1
AA Long Context Reasoning69Accuracy (%)91
UGI - Writing54Writing Score91
AA MMLU-Pro85.04Accuracy (%)90.8
UGI - Natural Intelligence46.34NatInt Score89.4
Gorilla API Bench (BFCL)56.73Overall Accuracy (%)86.6
AA AIME 202587.67Accuracy (%)85
AA Global-MMLU-Lite - German91.08Accuracy (%)83.9
AA Global-MMLU-Lite - French91.08Accuracy (%)82.9
AA Global-MMLU-Lite - Portuguese91Accuracy (%)81.7
AA Omniscience - Software Engineering (SWE) - Swift60Accuracy (%)80.9

Interactive version: theaggregate.ai/model?slug=deepseek-v3-2-exp-thinking · How the rankings work · Data refreshed daily, snapshot 2026-07-22.