Phi-4 (Reasoning) — benchmark results
Provider: Microsoft. Released 2025-04-30. Access: Open.
Unified ELO 1296 ± 34, rank #1540 of 1776 rated models, from 132 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| EuroEval Icelandic NLU - NQII | 55.92 | Reading comprehension Score (%) | 87.2 |
| EuroEval Finnish NLU - Tydiqa FI | 70.57 | Reading comprehension Score (%) | 85 |
| EuroEval German NLU - Germanquad | 58.9 | Reading comprehension Score (%) | 78.1 |
| EuroEval Portuguese NLU - MultiWikiQA PT | 73.65 | Reading comprehension Score (%) | 77.1 |
| Medmarks - MedHallu Hard | 48.36 | Score (%) | 77.1 |
| Medmarks - PubHealthBench Reviewed | 85.66 | Score (%) | 72.9 |
| Medmarks - LongHealth Task 1 | 87.83 | Score (%) | 69.3 |
| Medmarks - LongHealth Task 2 | 88 | Score (%) | 69.3 |
| SLMJury | 88.24 | Judge accuracy (%) | 66.7 |
| Medmarks - MedHallu Medium | 59.76 | Score (%) | 62.9 |
| EuroEval Italian NLU - SQuAD IT | 68.84 | Reading comprehension Score (%) | 61.8 |
| Medmarks - MMLU-Pro Health | 73.76 | Score (%) | 61.4 |
Interactive version: theaggregate.ai/model?slug=phi-4-reasoning · How the rankings work · Data refreshed daily, snapshot 2026-07-22.