DeepSeek V3.1 Terminus (Reasoning): benchmark results

DeepSeek V3.1 Terminus evaluated with reasoning enabled. Provider: DeepSeek. Released 2025-09-22. Access: Open.

Unified ELO 1582 ± 1, rank #505 of 1761 rated models, from 59 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
UGI Leaderboard51.26UGI Score91.9
AA AIME 202589.67Accuracy (%)90.7
AA MMLU-Pro85.11Accuracy (%)90.6
UGI - Writing54Writing Score90.3
AA LiveCodeBench79.79Pass@1 (%)90
UGI - Natural Intelligence49.47NatInt Score90
AA Omniscience - Software Engineering (SWE) - Dart28Accuracy (%)82.1
AA Omniscience - Software Engineering (SWE) - C50Accuracy (%)81.2
AA Omniscience - Software Engineering (SWE) - HTML44Accuracy (%)80.7
AA Omniscience - Software Engineering (SWE) - Julia24Accuracy (%)80.2
AA Omniscience - Software Engineering (SWE) - Go26Accuracy (%)78.2
AA Omniscience - Software Engineering (SWE) - JavaScript38.18Accuracy (%)77.5

Interactive version: theaggregate.ai/model?slug=deepseek-v3-1-terminus-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-05.