DeepSeek V3.1 — benchmark results

DeepSeek V3.1 open hybrid-reasoning MoE model (671B total, 37B active). Provider: DeepSeek. Released 2025-08-21. Access: Open.

Unified ELO 1664 ± 10, rank #333 of 1776 rated models, from 453 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
CFAgentBench67pass^1 (%)100
Exploring Autonomous Agentic Data Engineering7.13MATS Science (Scratch) (self-reported)100
PCB-Bench - Placement Macro QA BERTScore83.06BERTScore (%)100
PCB-Bench - Routing Macro QA BERTScore83.1BERTScore (%)100
PCB-Bench - Routing Micro QA BERTScore82.17BERTScore (%)100
Evals for Every Language - Language cgg100Average Score (%)99.2
Evals for Every Language - Language mak100Average Score (%)99.2
Evals for Every Language - Language da76.78Average Score (%)98.6
Evals for Every Language - Language ff83.33Average Score (%)98.5
Evals for Every Language - Language fy100Average Score (%)98.5
Evals for Every Language - Language tet100Average Score (%)97.7
Evals for Every Language - Language yue59.57Average Score (%)97.1

Interactive version: theaggregate.ai/model?slug=deepseek-v3-1 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.