Phi-4 Multimodal Instruct — benchmark results

Provider: Microsoft. Released 2025-02-26. Access: Open.

Unified ELO 1384 ± 15, rank #1294 of 1776 rated models, from 126 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AudioBench - AISHELL ASR ZH WER7.47WER (%) (lower is better)100
AudioBench - CoVoST2 EN-ZH BLEU45.3Mean Score (%)100
AudioBench - CoVoST2 ZH-EN BLEU22.68Mean Score (%)100
AudioBench - LibriSpeech Clean WER1.68WER (%) (lower is better)100
AudioBench - MMAU Music68.86Score (%)100
AudioBench - TED-LIUM 3 WER2.85WER (%) (lower is better)100
LatamBoard - Spanish MGSM15.2Score (%)90.9
AudioBench - CoVoST2 EN-TA BLEU19.84Mean Score (%)90
AudioBench - Common Voice 15 EN WER8.26WER (%) (lower is better)88.9
AudioBench - IMDA Part 1 ASR WER5.74WER (%) (lower is better)88.9
AudioBench - IMDA Part 6 ASR WER14.55WER (%) (lower is better)88.9
AudioBench - MMAU Mini56.95Mean Score (%)88.9

Interactive version: theaggregate.ai/model?slug=phi-4-multimodal-instruct · How the rankings work · Data refreshed daily, snapshot 2026-07-22.