DeepSeek V3 Chat — benchmark results

DeepSeek's open-weights MoE chat flagship (671B total/37B active, 128K context), trained natively in FP8 at unusually low cost (December 2024). Provider: DeepSeek. Released 2024-12-26. Access: Open.

Unified ELO 1562 ± 20, rank #585 of 1776 rated models, from 100 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
CyberSecEval2 Prompt Injection48.01Accuracy (%)100
DuckDB-NSQL80Execution Accuracy (%)100
Ru Arena Hard96.3Win Rate (%)100
VNTL Leaderboard74.24Accuracy (%)95.3
AGC-Bench - pun_eval1.22Dataset z-score95.1
AGC-Bench - story_generation_rocstories1.32Dataset z-score92.7
SpeechMap Compliance90% Requests Completed90.3
AGC-Bench - conceptual_design1.03Dataset z-score89
AGC-Bench - fann_or_flop0.92Dataset z-score85.4
AGC-Bench - unfun_corpus0.38Dataset z-score84.6
AGC-Bench - grapheval_ai_researcher0.7Dataset z-score82.7
AGC-Bench - ocw1.1Dataset z-score80.5

Interactive version: theaggregate.ai/model?slug=deepseek-v3-chat · How the rankings work · Data refreshed daily, snapshot 2026-07-22.