DeepSeek V3 Chat — benchmark results
DeepSeek's open-weights MoE chat flagship (671B total/37B active, 128K context), trained natively in FP8 at unusually low cost (December 2024). Provider: DeepSeek. Released 2024-12-26. Access: Open.
Unified ELO 1562 ± 20, rank #585 of 1776 rated models, from 100 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| CyberSecEval2 Prompt Injection | 48.01 | Accuracy (%) | 100 |
| DuckDB-NSQL | 80 | Execution Accuracy (%) | 100 |
| Ru Arena Hard | 96.3 | Win Rate (%) | 100 |
| VNTL Leaderboard | 74.24 | Accuracy (%) | 95.3 |
| AGC-Bench - pun_eval | 1.22 | Dataset z-score | 95.1 |
| AGC-Bench - story_generation_rocstories | 1.32 | Dataset z-score | 92.7 |
| SpeechMap Compliance | 90 | % Requests Completed | 90.3 |
| AGC-Bench - conceptual_design | 1.03 | Dataset z-score | 89 |
| AGC-Bench - fann_or_flop | 0.92 | Dataset z-score | 85.4 |
| AGC-Bench - unfun_corpus | 0.38 | Dataset z-score | 84.6 |
| AGC-Bench - grapheval_ai_researcher | 0.7 | Dataset z-score | 82.7 |
| AGC-Bench - ocw | 1.1 | Dataset z-score | 80.5 |
Interactive version: theaggregate.ai/model?slug=deepseek-v3-chat · How the rankings work · Data refreshed daily, snapshot 2026-07-22.