Phi-3-medium-128k-instruct: benchmark results

Microsoft's 14B Phi-3 Medium instruct model with a 128K context, trained on synthetic and filtered web data. Provider: Microsoft. Released 2024-05-21. Access: Open.

Unified ELO 1473 ± 1, rank #823 of 1392 rated models, from 60 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
ARC Challenge (AI2)91.6Accuracy (%)94.7
Big-Bench Hard81.4Average (%)93.8
OpenBookQA87.4Accuracy (%)92.9
Open LLM Leaderboard - BBH48.46Score88.7
BBH81.4Score (self-reported)86.7
Open LLM Leaderboard - MMLU-Pro41.24Score86
CanAiCode100Junior-v2 Python Pass Rate (%)85.6
Open LLM Leaderboard - GPQA11.52Score83
Open Korean LLM Leaderboard41.58Average Score (%)80.1
WinoGrande81.5Accuracy (%)79.4
MERA - BPS98.9Accuracy (%)79.1
MMLU78Accuracy (%)76.3

Interactive version: theaggregate.ai/model?slug=phi-3-medium-128k-instruct · How It Works · Data refreshed daily, snapshot 2026-09-05.