DeepSeek V3.1 Terminus: benchmark results
DeepSeek's V3.1 Terminus update with improved agentic tool use and language consistency. Provider: DeepSeek. Released 2025-09-22. Access: Open.
Unified ELO 1619 ± 1, rank #208 of 1392 rated models, from 151 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| UGI Leaderboard | 57.58 | UGI Score | 97.9 |
| AGC-Bench - ss_gen | 1.34 | Dataset z-score | 97.5 |
| TuRTLe - Verilator Syntax | 95.25 | Average Score (%) | 95.5 |
| AGC-Bench - conceptual_design | 1.3 | Dataset z-score | 93.9 |
| TuRTLe - Icarus Syntax | 93.7 | Average Score (%) | 93.2 |
| AGC-Bench - tinystories | 1.23 | Dataset z-score | 92.7 |
| WebCoderBench - Performance | 98.19 | Score (%) | 92.3 |
| AGC-Bench - puntuguese | 0.94 | Dataset z-score | 91.5 |
| AGC-Bench - tinyfabulist | 1.1 | Dataset z-score | 91.5 |
| AGC-Bench - outline_to_story | 1.14 | Dataset z-score | 91.4 |
| AGC-Bench - showerthoughts | 1 | Dataset z-score | 91.2 |
| TuRTLe - Verilator Power | 71.45 | Average Score (%) | 90.9 |
Interactive version: theaggregate.ai/model?slug=deepseek-v3-1-terminus · How It Works · Data refreshed daily, snapshot 2026-09-05.