DeepSeek V4 Flash (Reasoning, Max Effort) — benchmark results

DeepSeek V4 Flash reasoning max-effort evaluation mode. Provider: DeepSeek. Released 2026-04-23. Access: Open.

Unified ELO 1808 ± 21, rank #158 of 1806 rated models, from 37 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA IFBench79.18Accuracy (%)97.5
AA TAU-2 Bench95.03Accuracy (%)93.8
AA GPQA Diamond89.39Accuracy (%)90.9
AA Humanity's Last Exam34.85Accuracy (%)90.6
Artificial Analysis Intelligence Index42.12Intelligence Index90.1
CritPt7.1Accuracy (self-reported)88.9
AA Omniscience - Software Engineering (SWE) - Rust77.08Accuracy (%)88.6
AA Omniscience - Health37.3Accuracy (%)87.1
AA Omniscience - Science, Engineering & Mathematics42.8Accuracy (%)86.7
AA CritPt7.14Accuracy (%)86.3
AA Omniscience - Software Engineering (SWE) - C70Accuracy (%)85.6
AA Omniscience - Software Engineering (SWE) - Go50Accuracy (%)84.8

Interactive version: theaggregate.ai/model?slug=deepseek-v4-flash-reasoning-max-effort · How It Works · Data refreshed daily, snapshot 2026-08-07.