Phi-4-mini (Reasoning) — benchmark results
Provider: Microsoft. Released 2025-04-30. Access: Open.
Unified ELO 1237 ± 21, rank #1646 of 1776 rated models, from 109 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| HarmActionsEval | 2.84 | SafeActions@1 (self-reported) | 72.2 |
| EuroEval English NLU - CoNLL EN | 69.04 | Named entity recognition Score (%) | 50.6 |
| EuroEval Portuguese Knowledge | 39.64 | Knowledge Average Score (%) | 48 |
| EuroEval French Knowledge | 41.54 | Knowledge Average Score (%) | 43.7 |
| ZeroEval MATH-500 | 94.6 | MATH-500 Score | 41.9 |
| EuroEval German Knowledge | 38.36 | Knowledge Average Score (%) | 41.8 |
| EuroEval Spanish Knowledge | 35.22 | Knowledge Average Score (%) | 41.1 |
| EuroEval Swedish Knowledge | 30.63 | Knowledge Average Score (%) | 40.4 |
| EuroEval Spanish NLU - ScaLA ES | 5.8 | Linguistic acceptability Score (%) | 39.9 |
| EuroEval Dutch Knowledge | 35.12 | Knowledge Average Score (%) | 39.2 |
| EuroEval Italian Knowledge | 32.58 | Knowledge Average Score (%) | 39.1 |
| EuroEval Icelandic NLU - ScaLA IS | 1.17 | Linguistic acceptability Score (%) | 37.7 |
Interactive version: theaggregate.ai/model?slug=phi-4-mini-reasoning · How the rankings work · Data refreshed daily, snapshot 2026-07-22.