Phi-4 (Reasoning): benchmark results

Provider: Microsoft. Released 2025-04-30. Access: Open.

Unified ELO 1436 ± 1, rank #1184 of 1761 rated models, from 134 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
EuroEval Icelandic NLU - NQII55.92Reading comprehension Score (%)87.2
EuroEval Finnish NLU - Tydiqa FI70.57Reading comprehension Score (%)85
EuroEval German NLU - Germanquad58.9Reading comprehension Score (%)78.1
EuroEval Portuguese NLU - MultiWikiQA PT73.65Reading comprehension Score (%)77.1
Medmarks - MedHallu Hard48.36Score (%)77.1
Medmarks - PubHealthBench Reviewed85.66Score (%)72.9
Medmarks - LongHealth Task 187.83Score (%)69.3
Medmarks - LongHealth Task 288Score (%)69.3
MIST (Selective Trust)88.3Overall Accuracy (%)68.2
SLMJury88.24Judge accuracy (%)66.7
Medmarks - MedHallu Medium59.76Score (%)62.9
EuroEval Italian NLU - SQuAD IT68.84Reading comprehension Score (%)61.8

Interactive version: theaggregate.ai/model?slug=phi-4-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-05.