DeepSeek V4 Flash (Reasoning, High Effort): benchmark results

DeepSeek V4 Flash reasoning high-effort evaluation mode. Provider: DeepSeek. Released 2026-04-23. Access: Open.

Unified ELO 1639 ± 1, rank #285 of 1761 rated models, from 34 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA TAU-2 Bench95.61Accuracy (%)95.3
AA Omniscience - Software Engineering (SWE) - PHP52Accuracy (%)94.9
AA Omniscience - Software Engineering (SWE) - TypeScript50Accuracy (%)94.2
AA Omniscience - Software Engineering (SWE) - Python41Accuracy (%)92.2
AA IFBench73.47Accuracy (%)91.1
AA Omniscience - Software Engineering (SWE) - R34Accuracy (%)91
AA Omniscience - Software Engineering (SWE) - C60Accuracy (%)90.8
AA Omniscience - Software Engineering (SWE) - Kotlin38Accuracy (%)90.4
AA Omniscience - Software Engineering (SWE) - Julia32Accuracy (%)90.1
AA Omniscience - Software Engineering (SWE) - JavaScript46.36Accuracy (%)88.4
AA Omniscience - Software Engineering (SWE) - Dart32Accuracy (%)87.4
AA Omniscience - Software Engineering (SWE) - Swift52Accuracy (%)86.7

Interactive version: theaggregate.ai/model?slug=deepseek-v4-flash-reasoning-high-effort · How It Works · Data refreshed daily, snapshot 2026-09-05.