Phi-4 (Reasoning): benchmark results
Provider: Microsoft. Released 2025-04-30. Access: Open.
Unified ELO 1436 ± 1, rank #1184 of 1761 rated models, from 134 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| EuroEval Icelandic NLU - NQII | 55.92 | Reading comprehension Score (%) | 87.2 |
| EuroEval Finnish NLU - Tydiqa FI | 70.57 | Reading comprehension Score (%) | 85 |
| EuroEval German NLU - Germanquad | 58.9 | Reading comprehension Score (%) | 78.1 |
| EuroEval Portuguese NLU - MultiWikiQA PT | 73.65 | Reading comprehension Score (%) | 77.1 |
| Medmarks - MedHallu Hard | 48.36 | Score (%) | 77.1 |
| Medmarks - PubHealthBench Reviewed | 85.66 | Score (%) | 72.9 |
| Medmarks - LongHealth Task 1 | 87.83 | Score (%) | 69.3 |
| Medmarks - LongHealth Task 2 | 88 | Score (%) | 69.3 |
| MIST (Selective Trust) | 88.3 | Overall Accuracy (%) | 68.2 |
| SLMJury | 88.24 | Judge accuracy (%) | 66.7 |
| Medmarks - MedHallu Medium | 59.76 | Score (%) | 62.9 |
| EuroEval Italian NLU - SQuAD IT | 68.84 | Reading comprehension Score (%) | 61.8 |
Interactive version: theaggregate.ai/model?slug=phi-4-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-05.