DeepSeek V3.1 Terminus (Non-reasoning) — benchmark results
Provider: DeepSeek. Released 2025-09-22. Access: Open.
Unified ELO 1608 ± 17, rank #476 of 1841 rated models, from 35 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AA MMLU-Pro | 83.6 | Accuracy (%) | 84.9 |
| AA Omniscience - Software Engineering (SWE) - Java | 28 | Accuracy (%) | 76.7 |
| AA Omniscience - Software Engineering (SWE) - Go | 32 | Accuracy (%) | 75.9 |
| AA Terminal-Bench Hard | 31.82 | Accuracy (%) | 75.3 |
| AA Omniscience - Humanities & Social Sciences | 26.3 | Accuracy (%) | 70.5 |
| AA Omniscience - Business | 21.1 | Accuracy (%) | 67.5 |
| AA Omniscience - Law | 16.6 | Accuracy (%) | 67.3 |
| AA Omniscience - Software Engineering (SWE) - R | 20 | Accuracy (%) | 66 |
| AA Omniscience - Software Engineering (SWE) - Dart | 26 | Accuracy (%) | 65.5 |
| AA Omniscience - Software Engineering (SWE) - Julia | 20 | Accuracy (%) | 64.8 |
| AA Omniscience - Health | 22.3 | Accuracy (%) | 62.7 |
| AA Omniscience - Software Engineering (SWE) - C | 45 | Accuracy (%) | 62.6 |
Interactive version: theaggregate.ai/model?slug=deepseek-v3-1-terminus-non-reasoning · How It Works · Data refreshed daily, snapshot 2026-07-25.