Phi-3 Mini 128K Instruct — benchmark results

Provider: Microsoft. Released 2024-04-23. Access: Open.

Unified ELO 1386 ± 15, rank #1281 of 1776 rated models, from 66 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - BBH37.1Score76.6
BiGGen-Bench3.68Average Score (1-5)75.5
Open LLM Leaderboard - GPQA9.06Score73.8
Open LLM Leaderboard - IFEval59.76Score71.7
LiveBench Cta52Score65.3
Open LLM Leaderboard - MMLU-Pro30.38Score61.8
Open LLM Leaderboard - MATH Level 514.05Score60.3
EuroEval Portuguese NLU - ScaLA PT16.29Linguistic acceptability Score (%)58.4
LiveBench Table Reformat44Score54.2
Open Chinese LLM - TruthfulQA MC53.96Accuracy (%)53.6
SpeechMap Compliance64.3% Requests Completed52.7
BABILong (NIAH)45.4Avg Accuracy (%)51.7

Interactive version: theaggregate.ai/model?slug=phi-3-mini-128k-instruct · How the rankings work · Data refreshed daily, snapshot 2026-07-22.