Phi-4: benchmark results
Microsoft Phi-4 14B model. Provider: Microsoft. Released 2024-12-12. Access: Open.
Unified ELO 1497 ± 1, rank #695 of 1392 rated models, from 676 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| MT-Bench PL - Reasoning | 9.55 | Judge Score (0-10) | 100 |
| SLMJury | 89.67 | Judge accuracy (%) | 100 |
| Open LLM Leaderboard - GPQA | 20.81 | Score | 99.5 |
| MT-Bench PL - STEM | 10 | Judge Score (0-10) | 99 |
| Open LLM Leaderboard - MuSR | 23.79 | Score | 98.6 |
| Open LLM Leaderboard - BBH | 55.25 | Score | 97.2 |
| Vectara Hallucination Leaderboard | 96.3 | Factual Consistency Rate (%) | 97.1 |
| Open LLM Leaderboard - MATH Level 5 | 50 | Score | 97 |
| MT-Bench PL - Overall | 9.07 | Judge Score (0-10) | 95.9 |
| Open LLM Leaderboard - MMLU-Pro | 48.65 | Score | 94.9 |
| French LLM Leaderboard - GPQA FR | 46.52 | Score (%) | 94.4 |
| Enkrypt AI - Safety Risk | 18.29 | Risk Score | 92 |
Interactive version: theaggregate.ai/model?slug=phi-4 · How It Works · Data refreshed daily, snapshot 2026-09-05.