Phi-3-small-128k-instruct: benchmark results

Microsoft's 7B Phi-3 Small instruct model with a 128K context, trained on synthetic and filtered web data. Provider: Microsoft. Released 2024-05-07. Access: Open.

Unified ELO 1474 ± 1, rank #819 of 1392 rated models, from 21 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - BBH45.63Score85.7
Open LLM Leaderboard - MMLU-Pro38.78Score83.5
Open LLM Leaderboard - MuSR14.5Score79.2
Enkrypt AI - Safety Risk21.28Risk Score78.6
Open LLM Leaderboard - IFEval63.68Score75.9
Open LLM Leaderboard - GPQA8.95Score73.2
Open LLM Leaderboard - MATH Level 520.26Score71.4
Enkrypt AI - Insecure Code Risk17.33Risk Score70.6
BenchBench65.61Aggregate Score (%)69.9
Enkrypt AI - Risk Score30.39Risk Score57.6
ChineseSafe Benchmark67.43Accuracy (%)55.6
Enkrypt AI - Toxicity Risk3.27Risk Score51.5

Interactive version: theaggregate.ai/model?slug=phi-3-small-128k-instruct · How It Works · Data refreshed daily, snapshot 2026-09-05.