DeepSeek V3.1 (Thinking): benchmark results
DeepSeek V3.1 evaluated with thinking enabled. Provider: DeepSeek. Released 2025-08-21. Access: Open.
Unified ELO 1599 ± 1, rank #443 of 1761 rated models, from 72 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| LLM2014 Code 2025-09 - C# | 8.7 | Score | 100 |
| LLM2014 Code 2025-09 - TypeScript | 9.38 | Score | 100 |
| LLM2014 Code 2025-09 - C++ | 6.19 | Score | 94.7 |
| LLM2014 Logic 2025-09 | 54.13 | Median Score | 91.1 |
| UGI Leaderboard | 50.59 | UGI Score | 90.4 |
| UGI - Writing | 51.85 | Writing Score | 89.2 |
| UGI - Natural Intelligence | 46.89 | NatInt Score | 88.9 |
| LLM2014 Code 2025-09 - Python | 7.36 | Score | 84.2 |
| LLM2014 Logic 2025-08 | 56.82 | Median Score | 84.1 |
| LLM2014 Code 2025-09 - Golang | 5.17 | Score | 78.9 |
| LLM2014 Code 2025-09 | 47.5 | Median Score | 77.8 |
| Chatbot Arena (Text - Longer Query) | 1446 | Arena Score | 77.2 |
Interactive version: theaggregate.ai/model?slug=deepseek-v3-1-thinking · How It Works · Data refreshed daily, snapshot 2026-09-05.