Phi-3-small-128k-instruct — benchmark results

Microsoft's 7B Phi-3 Small instruct model with a 128K context, trained on synthetic and filtered web data. Provider: Microsoft. Released 2024-05-07. Access: Open.

Unified ELO 1450 ± 16, rank #1000 of 1776 rated models, from 32 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - BBH45.63Score85.7
Open LLM Leaderboard - MMLU-Pro38.78Score83.5
Open LLM Leaderboard - MuSR14.5Score79.2
Open LLM Leaderboard - IFEval63.68Score75.9
Open LLM Leaderboard - GPQA8.95Score73.2
Open LLM Leaderboard - MATH Level 520.26Score71.4
BenchBench65.61Aggregate Score (%)69.9
LiveBench AMPS Hard28Score63.2
LiveBench Web Of Lies V228Score58.3
ChineseSafe Benchmark67.43Accuracy (%)55.6
LiveBench Coding Completion19.74Score55.6
LiveBench LCB Generation30Score53.5

Interactive version: theaggregate.ai/model?slug=phi-3-small-128k-instruct · How the rankings work · Data refreshed daily, snapshot 2026-07-22.