DeepSeek V3.1 Terminus (Thinking): benchmark results
Provider: DeepSeek. Released 2025-09-22. Access: Open.
Unified ELO 1646 ± 1, rank #363 of 3078 rated models, from 50 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Chatbot Arena (Text - Legal & Government) | 1463 | Arena Score | 83 |
| Chatbot Arena (Text - Medicine & Healthcare) | 1464 | Arena Score | 78.6 |
| Chatbot Arena (Text - Longer Query) | 1448 | Arena Score | 78.2 |
| SuperCLUE General (September 2025) - Agent | 75.83 | Score | 77.8 |
| SuperCLUE General (September 2025) - Science Reasoning | 47.41 | Score | 77.8 |
| Chatbot Arena (Text - Writing, Literature & Language) | 1412 | Arena Score | 77.5 |
| AGI-Eval Community - Learning (Chinese) | 82.86 | Accuracy (%) | 76.4 |
| Chatbot Arena (Text - Instruction Following) | 1421 | Arena Score | 75.9 |
| AGI-Eval Community - Interaction (English) | 92.49 | Accuracy (%) | 75.4 |
| Wolfram LLM Benchmarking Project | 53 | Correct Functionality (%) | 75.4 |
| AGI-Eval Community - General Reasoning | 97.02 | Accuracy (%) | 75 |
| Chatbot Arena (Text - Russian) | 1430 | Arena Score | 74.7 |
Interactive version: theaggregate.ai/model?slug=deepseek-v3-1-terminus-thinking · How It Works · Data refreshed daily, snapshot 2026-09-19.