phi-4-14B: benchmark results

Microsoft's 14B Phi-4 trained heavily on synthetic data, with weights released on Hugging Face under MIT in January 2025. Provider: Microsoft. Released 2025-01-16. Access: Open.

Unified ELO 1516 ± 1, rank #624 of 1392 rated models, from 17 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - GPQA20.47Score99.3
Open LLM Leaderboard - MuSR23.99Score98.7
Open LLM Leaderboard - BBH52.5Score95.3
Open LLM Leaderboard - MMLU-Pro47.54Score92
GSMA Open-Telco - srsRAN-Bench83.36Score (%)84.1
Open LLM Leaderboard - MATH Level 529.38Score81.4
When Context Flips, Safety Breaks35.9PacifAIst BSR (self-reported)63.6
GSMA Open-Telco - TeleTables29.93Score (%)51.1
GSMA Open-Telco LLM Leaderboard50.45Average Score (%)46.6
GSMA Open-Telco - TeleLogs19.79Score (%)44.3
GSMA Open-Telco - TeleMath40.07Score (%)44.3
GSMA Open-Telco - ORAN-Bench73.69Score (%)43.2

Interactive version: theaggregate.ai/model?slug=phi-4-14b · How It Works · Data refreshed daily, snapshot 2026-09-05.