Phi-2 — benchmark results

Provider: Microsoft. Released 2023-12-12. Access: Open.

Unified ELO 1251 ± 17, rank #1612 of 1776 rated models, from 111 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open CoT - LogiQA6.23CoT Gain (%)79.4
OpenBookQA73.6Accuracy (%)78.6
Open LLM Leaderboard - MuSR13.84Score76.2
Big-Bench Hard59.4Average (%)72.9
NPHardEval - GCP D55.82Accuracy (%)72.7
ARC Challenge (AI2)75.9Accuracy (%)71.8
URIAL-Bench - Coding4.25Judge Score (0-10)66.7
URIAL-Bench - Humanities8.85Judge Score (0-10)66.7
URIAL-Bench - Math3.8Judge Score (0-10)66.7
Open CoT - LogiQA 28.65CoT Gain (%)60.3
EvoEval Combine14Pass@1 (%)58
Open CoT Leaderboard8.08Average CoT Gain (%)56.5

Interactive version: theaggregate.ai/model?slug=phi-2 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.