Phi-4 Multimodal Instruct — benchmark results
Provider: Microsoft. Released 2025-02-26. Access: Open.
Unified ELO 1384 ± 15, rank #1294 of 1776 rated models, from 126 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AudioBench - AISHELL ASR ZH WER | 7.47 | WER (%) (lower is better) | 100 |
| AudioBench - CoVoST2 EN-ZH BLEU | 45.3 | Mean Score (%) | 100 |
| AudioBench - CoVoST2 ZH-EN BLEU | 22.68 | Mean Score (%) | 100 |
| AudioBench - LibriSpeech Clean WER | 1.68 | WER (%) (lower is better) | 100 |
| AudioBench - MMAU Music | 68.86 | Score (%) | 100 |
| AudioBench - TED-LIUM 3 WER | 2.85 | WER (%) (lower is better) | 100 |
| LatamBoard - Spanish MGSM | 15.2 | Score (%) | 90.9 |
| AudioBench - CoVoST2 EN-TA BLEU | 19.84 | Mean Score (%) | 90 |
| AudioBench - Common Voice 15 EN WER | 8.26 | WER (%) (lower is better) | 88.9 |
| AudioBench - IMDA Part 1 ASR WER | 5.74 | WER (%) (lower is better) | 88.9 |
| AudioBench - IMDA Part 6 ASR WER | 14.55 | WER (%) (lower is better) | 88.9 |
| AudioBench - MMAU Mini | 56.95 | Mean Score (%) | 88.9 |
Interactive version: theaggregate.ai/model?slug=phi-4-multimodal-instruct · How the rankings work · Data refreshed daily, snapshot 2026-07-22.