DeepSeek V4 Pro (Reasoning, Max Effort) — benchmark results

DeepSeek V4 Pro reasoning max-effort evaluation mode. Provider: DeepSeek. Released 2026-04-23. Access: Open.

Unified ELO 1832 ± 13, rank #112 of 1776 rated models, from 77 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Qwen3.7 Launch - CritPT12.9Score (%)100
Qwen3.7 Launch - LiveCodeBench93.5Score (%)100
Qwen3.7 Launch - Vitabench51.9Score (%)100
AA TAU-2 Bench96.2Accuracy (%)96.8
AA IFBench76.46Accuracy (%)95.5
AA Omniscience - Humanities & Social Sciences47.7Accuracy (%)95.5
AA Omniscience - Science, Engineering & Mathematics45.5Accuracy (%)94.2
Artificial Analysis Intelligence Index44.27Intelligence Index94.2
AA Omniscience - Health40.6Accuracy (%)94
AA Humanity's Last Exam35.87Accuracy (%)93.7
AA CritPt12.86Accuracy (%)93.4
AA Terminal-Bench Hard46.21Accuracy (%)92.9

Interactive version: theaggregate.ai/model?slug=deepseek-v4-pro-reasoning-max-effort · How the rankings work · Data refreshed daily, snapshot 2026-07-22.