Phi-3-medium-128k-instruct — benchmark results

Microsoft's 14B Phi-3 Medium instruct model with a 128K context, trained on synthetic and filtered web data. Provider: Microsoft. Released 2024-05-21. Access: Open.

Unified ELO 1451 ± 16, rank #993 of 1776 rated models, from 47 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
OpenBookQA87.4Accuracy (%)95.2
Big-Bench Hard81.4Average (%)93.8
ARC Challenge (AI2)91.6Accuracy (%)93.6
Open Korean LLM Leaderboard568.43Average Score (%)92.4
Open LLM Leaderboard - BBH48.46Score88.7
Open LLM Leaderboard - MMLU-Pro41.24Score86
CanAiCode100Junior-v2 Python Pass Rate (%)85.6
Open LLM Leaderboard - GPQA11.52Score83.1
WinoGrande81.5Accuracy (%)79.4
MMLU78Accuracy (%)76.3
BABILong (NIAH)57.3Avg Accuracy (%)75.9
HellaSwag82.4Accuracy (%)72.4

Interactive version: theaggregate.ai/model?slug=phi-3-medium-128k-instruct · How the rankings work · Data refreshed daily, snapshot 2026-07-22.