Phi-4 — benchmark results

Microsoft Phi-4 14B model. Provider: Microsoft. Released 2024-12-12. Access: Open.

Unified ELO 1482 ± 6, rank #867 of 1776 rated models, from 625 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
MT-Bench PL - Reasoning9.55Judge Score (0-10)100
SLMJury89.67Judge accuracy (%)100
Open LLM Leaderboard - GPQA20.81Score99.5
MT-Bench PL - STEM10Judge Score (0-10)99
Open LLM Leaderboard - MuSR23.79Score98.6
Open LLM Leaderboard - BBH55.25Score97.2
Vectara Hallucination Leaderboard96.3Factual Consistency Rate (%)97.1
Open LLM Leaderboard - MATH Level 550Score97
MT-Bench PL - Overall9.07Judge Score (0-10)95.9
Open LLM Leaderboard - MMLU-Pro48.65Score94.9
French LLM Leaderboard - GPQA FR46.52Score (%)94.4
AILuminate Safety4Safety Grade (1-5)91.9

Interactive version: theaggregate.ai/model?slug=phi-4 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.