Phi-2: benchmark results

Provider: Microsoft. Released 2023-12-12. Access: Open.

Unified ELO 1339 ± 1, rank #1289 of 1392 rated models, from 115 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Enkrypt AI - Bias Risk68.48Risk Score80.9
Open CoT - LogiQA6.23CoT Gain (%)79.4
OpenBookQA73.6Accuracy (%)78.6
Open LLM Leaderboard - MuSR13.84Score76.1
ARC Challenge (AI2)75.9Accuracy (%)73.7
Big-Bench Hard59.4Average (%)72.9
NPHardEval - GCP D55.82Accuracy (%)72.7
URIAL-Bench - Coding4.25Judge Score (0-10)66.7
URIAL-Bench - Humanities8.85Judge Score (0-10)66.7
URIAL-Bench - Math3.8Judge Score (0-10)66.7
Open CoT - LogiQA 28.65CoT Gain (%)60.3
EvoEval Combine14Pass@1 (%)58

Interactive version: theaggregate.ai/model?slug=phi-2 · How It Works · Data refreshed daily, snapshot 2026-09-05.