Phi-4 — benchmark results
Microsoft Phi-4 14B model. Provider: Microsoft. Released 2024-12-12. Access: Open.
Unified ELO 1482 ± 6, rank #867 of 1776 rated models, from 625 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| MT-Bench PL - Reasoning | 9.55 | Judge Score (0-10) | 100 |
| SLMJury | 89.67 | Judge accuracy (%) | 100 |
| Open LLM Leaderboard - GPQA | 20.81 | Score | 99.5 |
| MT-Bench PL - STEM | 10 | Judge Score (0-10) | 99 |
| Open LLM Leaderboard - MuSR | 23.79 | Score | 98.6 |
| Open LLM Leaderboard - BBH | 55.25 | Score | 97.2 |
| Vectara Hallucination Leaderboard | 96.3 | Factual Consistency Rate (%) | 97.1 |
| Open LLM Leaderboard - MATH Level 5 | 50 | Score | 97 |
| MT-Bench PL - Overall | 9.07 | Judge Score (0-10) | 95.9 |
| Open LLM Leaderboard - MMLU-Pro | 48.65 | Score | 94.9 |
| French LLM Leaderboard - GPQA FR | 46.52 | Score (%) | 94.4 |
| AILuminate Safety | 4 | Safety Grade (1-5) | 91.9 |
Interactive version: theaggregate.ai/model?slug=phi-4 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.