Phi-4 (Reasoning) — benchmark results

Provider: Microsoft. Released 2025-04-30. Access: Open.

Unified ELO 1296 ± 34, rank #1540 of 1776 rated models, from 132 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
EuroEval Icelandic NLU - NQII55.92Reading comprehension Score (%)87.2
EuroEval Finnish NLU - Tydiqa FI70.57Reading comprehension Score (%)85
EuroEval German NLU - Germanquad58.9Reading comprehension Score (%)78.1
EuroEval Portuguese NLU - MultiWikiQA PT73.65Reading comprehension Score (%)77.1
Medmarks - MedHallu Hard48.36Score (%)77.1
Medmarks - PubHealthBench Reviewed85.66Score (%)72.9
Medmarks - LongHealth Task 187.83Score (%)69.3
Medmarks - LongHealth Task 288Score (%)69.3
SLMJury88.24Judge accuracy (%)66.7
Medmarks - MedHallu Medium59.76Score (%)62.9
EuroEval Italian NLU - SQuAD IT68.84Reading comprehension Score (%)61.8
Medmarks - MMLU-Pro Health73.76Score (%)61.4

Interactive version: theaggregate.ai/model?slug=phi-4-reasoning · How the rankings work · Data refreshed daily, snapshot 2026-07-22.