DeepSeek V3.1 Terminus (Thinking): benchmark results

Provider: DeepSeek. Released 2025-09-22. Access: Open.

Unified ELO 1646 ± 1, rank #363 of 3078 rated models, from 50 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Chatbot Arena (Text - Legal & Government)1463Arena Score83
Chatbot Arena (Text - Medicine & Healthcare)1464Arena Score78.6
Chatbot Arena (Text - Longer Query)1448Arena Score78.2
SuperCLUE General (September 2025) - Agent75.83Score77.8
SuperCLUE General (September 2025) - Science Reasoning47.41Score77.8
Chatbot Arena (Text - Writing, Literature & Language)1412Arena Score77.5
AGI-Eval Community - Learning (Chinese)82.86Accuracy (%)76.4
Chatbot Arena (Text - Instruction Following)1421Arena Score75.9
AGI-Eval Community - Interaction (English)92.49Accuracy (%)75.4
Wolfram LLM Benchmarking Project53Correct Functionality (%)75.4
AGI-Eval Community - General Reasoning97.02Accuracy (%)75
Chatbot Arena (Text - Russian)1430Arena Score74.7

Interactive version: theaggregate.ai/model?slug=deepseek-v3-1-terminus-thinking · How It Works · Data refreshed daily, snapshot 2026-09-19.