DeepSeek-V4-Flash-Vision-Exp (Max): benchmark results
Provider: DeepSeek. Released 2026-08-21. Access: Open.
Unified ELO 1653 ± 1, rank #163 of 2032 rated models, from 75 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Nejumi 4 - jaster (2-shot) - JCoLA (out-of-domain) | 89 | Exact match (%) | 94.9 |
| Nejumi 4 - jaster (0-shot) - CommonsenseMoralJA | 97 | Exact match (%) | 94.1 |
| Nejumi 4 - ARC-AGI-1 | 98 | Accuracy (%) | 93 |
| Korean CSAT 2026 (Easy Mode) - Korean | 100 | Points (out of 100) | 92.5 |
| Korean CSAT 2026 (Easy Mode) - English | 100 | Points (out of 100) | 90.5 |
| Nejumi 4 - BFCL - Relevance Detection | 88.89 | Accuracy (%) | 89 |
| Nejumi 4 - HLE (Japanese) - Calibration Error | 53 | Calibration error (%) | 87.5 |
| Nejumi 4 - jaster (0-shot) - NIILC | 57.72 | Character F1 (x100) | 87.5 |
| Nejumi 4 - HLE (Japanese) - Accuracy | 38.14 | Accuracy (%) | 86.8 |
| Nejumi 4 - jaster (0-shot) - KUCI | 87 | Exact match (%) | 86 |
| Nejumi 4 - jaster (0-shot) - MMLU-ProX (Japanese) | 89 | Exact match (%) | 84.9 |
| Nejumi 4 - jaster (2-shot) - ALT English-to-Japanese | 92.54 | COMET wmt22 (x100) | 84.9 |
Interactive version: theaggregate.ai/model?slug=deepseek-v4-flash-vision-exp-max · How It Works · Data refreshed daily, snapshot 2026-09-26.