phi-4-14B — benchmark results

Microsoft's 14B Phi-4 trained heavily on synthetic data, with weights released on Hugging Face under MIT in January 2025. Provider: Microsoft. Released 2025-01-16. Access: Open.

Unified ELO 1425 ± 93, rank #1107 of 1776 rated models, from 18 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - GPQA20.47Score99.3
Open LLM Leaderboard - MuSR23.99Score98.7
Open LLM Leaderboard - BBH52.5Score95.3
Open LLM Leaderboard - MMLU-Pro47.54Score92
GSMA Open-Telco - srsRAN-Bench83.36Score (%)84.9
Open LLM Leaderboard - MATH Level 529.38Score81.4
When Context Flips, Safety Breaks35.9PacifAIst BSR (self-reported)63.6
GSMA Open-Telco - TeleTables29.93Score (%)52.3
GSMA Open-Telco LLM Leaderboard50.45Average Score (%)47.7
GSMA Open-Telco - TeleLogs19.79Score (%)45.3
GSMA Open-Telco - TeleMath40.07Score (%)45.3
GSMA Open-Telco - ORAN-Bench73.69Score (%)44.2

Interactive version: theaggregate.ai/model?slug=phi-4-14b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.