DeepSeek V4 Flash (Reasoning, Max Effort): benchmark results

DeepSeek V4 Flash reasoning max-effort evaluation mode. Provider: DeepSeek. Released 2026-04-24. Access: Open.

Unified ELO 1650 ± 1, rank #343 of 3081 rated models, from 19 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA Omniscience - Software Engineering (SWE) - Rust77.08Accuracy (%)96.9
AA Omniscience - Software Engineering (SWE) - Go50Accuracy (%)96.4
AA Omniscience - Software Engineering (SWE) - C70Accuracy (%)95.9
AA Omniscience - Software Engineering (SWE) - TypeScript54.44Accuracy (%)95.7
AA Omniscience - Software Engineering (SWE) - Dart40Accuracy (%)94.5
Tau2-Bench Telecom95.03Success Rate (%)93.9
AA Omniscience - Software Engineering (SWE) - HTML55.1Accuracy (%)92.5
AA Omniscience - Software Engineering (SWE) - R36Accuracy (%)92.2
AA Omniscience - Software Engineering (SWE) - Python40.5Accuracy (%)91.5
AA Omniscience - Software Engineering (SWE) - Java30Accuracy (%)90.4
AA Omniscience - Software Engineering (SWE) - Kotlin38Accuracy (%)90.4
AA Omniscience - Software Engineering (SWE) - PHP46Accuracy (%)90.3

Interactive version: theaggregate.ai/model?slug=deepseek-v4-flash-reasoning-max-effort · How It Works · Data refreshed daily, snapshot 2026-09-21.