DeepSeek V4 Flash — benchmark results
DeepSeek's efficient open V4 Flash MoE model (13B active). Provider: DeepSeek. Released 2026-04-23. Access: Open.
Unified ELO 1741 ± 12, rank #211 of 1776 rated models, from 160 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| ATRBench | 23.7 | TSAcc Default (%) (self-reported) | 100 |
| IMO-AnswerBench | 91.1 | Score (self-reported) | 96.2 |
| Vellum - LiveCodeBench | 91.6 | Pass@1 (%) | 95.5 |
| Beyond the All-in-One Agent | 57.33 | avg. (self-reported) | 90.9 |
| OpenCompass Agent - Tool Use | 46.7 | Score (%) | 90.9 |
| OpenCompass LLM - Agent | 46.7 | Score (%) | 90.9 |
| PlanBench-XL | 63.08 | Accuracy (%) (self-reported) | 88.9 |
| PinchBench | 91.46 | Success Rate (%) | 86 |
| ClawProBench | 61.47 | Final Score (self-reported) | 85.7 |
| Frontier Security Agents - Cybench Hard | 86.4 | Success rate (%) | 85.7 |
| FullHome | 63 | Goal SR (VirtualHome) (self-reported) | 85.7 |
| MLX Benchmark V2 - MLX Core | 86.17 | Accuracy (%) | 85.7 |
Interactive version: theaggregate.ai/model?slug=deepseek-v4-flash · How the rankings work · Data refreshed daily, snapshot 2026-07-22.