DeepSeek V3.1 Terminus — benchmark results
DeepSeek's V3.1 Terminus update with improved agentic tool use and language consistency. Provider: DeepSeek. Released 2025-09-22. Access: Open.
Unified ELO 1662 ± 12, rank #340 of 1776 rated models, from 136 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| UGI Leaderboard | 57.58 | UGI Score | 97.9 |
| AGC-Bench - ss_gen | 1.34 | Dataset z-score | 97.5 |
| TuRTLe - Verilator Syntax | 95.25 | Average Score (%) | 95.3 |
| AGC-Bench - conceptual_design | 1.3 | Dataset z-score | 93.9 |
| TuRTLe - Icarus Syntax | 93.7 | Average Score (%) | 93 |
| AGC-Bench - tinystories | 1.23 | Dataset z-score | 92.7 |
| WebCoderBench - Performance | 98.19 | Score (%) | 92.3 |
| AGC-Bench - puntuguese | 0.94 | Dataset z-score | 91.5 |
| AGC-Bench - tinyfabulist | 1.1 | Dataset z-score | 91.5 |
| AGC-Bench - outline_to_story | 1.14 | Dataset z-score | 91.4 |
| AGC-Bench - showerthoughts | 1 | Dataset z-score | 91.2 |
| TuRTLe - Verilator Power | 71.45 | Average Score (%) | 90.7 |
Interactive version: theaggregate.ai/model?slug=deepseek-v3-1-terminus · How the rankings work · Data refreshed daily, snapshot 2026-07-22.