DeepSeek V4 Flash (Reasoning, Max Effort): benchmark results
DeepSeek V4 Flash reasoning max-effort evaluation mode. Provider: DeepSeek. Released 2026-04-24. Access: Open.
Unified ELO 1650 ± 1, rank #343 of 3081 rated models, from 19 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AA Omniscience - Software Engineering (SWE) - Rust | 77.08 | Accuracy (%) | 96.9 |
| AA Omniscience - Software Engineering (SWE) - Go | 50 | Accuracy (%) | 96.4 |
| AA Omniscience - Software Engineering (SWE) - C | 70 | Accuracy (%) | 95.9 |
| AA Omniscience - Software Engineering (SWE) - TypeScript | 54.44 | Accuracy (%) | 95.7 |
| AA Omniscience - Software Engineering (SWE) - Dart | 40 | Accuracy (%) | 94.5 |
| Tau2-Bench Telecom | 95.03 | Success Rate (%) | 93.9 |
| AA Omniscience - Software Engineering (SWE) - HTML | 55.1 | Accuracy (%) | 92.5 |
| AA Omniscience - Software Engineering (SWE) - R | 36 | Accuracy (%) | 92.2 |
| AA Omniscience - Software Engineering (SWE) - Python | 40.5 | Accuracy (%) | 91.5 |
| AA Omniscience - Software Engineering (SWE) - Java | 30 | Accuracy (%) | 90.4 |
| AA Omniscience - Software Engineering (SWE) - Kotlin | 38 | Accuracy (%) | 90.4 |
| AA Omniscience - Software Engineering (SWE) - PHP | 46 | Accuracy (%) | 90.3 |
Interactive version: theaggregate.ai/model?slug=deepseek-v4-flash-reasoning-max-effort · How It Works · Data refreshed daily, snapshot 2026-09-21.