Phi-2: benchmark results
Provider: Microsoft. Released 2023-12-12. Access: Open.
Unified ELO 1339 ± 1, rank #1289 of 1392 rated models, from 115 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Enkrypt AI - Bias Risk | 68.48 | Risk Score | 80.9 |
| Open CoT - LogiQA | 6.23 | CoT Gain (%) | 79.4 |
| OpenBookQA | 73.6 | Accuracy (%) | 78.6 |
| Open LLM Leaderboard - MuSR | 13.84 | Score | 76.1 |
| ARC Challenge (AI2) | 75.9 | Accuracy (%) | 73.7 |
| Big-Bench Hard | 59.4 | Average (%) | 72.9 |
| NPHardEval - GCP D | 55.82 | Accuracy (%) | 72.7 |
| URIAL-Bench - Coding | 4.25 | Judge Score (0-10) | 66.7 |
| URIAL-Bench - Humanities | 8.85 | Judge Score (0-10) | 66.7 |
| URIAL-Bench - Math | 3.8 | Judge Score (0-10) | 66.7 |
| Open CoT - LogiQA 2 | 8.65 | CoT Gain (%) | 60.3 |
| EvoEval Combine | 14 | Pass@1 (%) | 58 |
Interactive version: theaggregate.ai/model?slug=phi-2 · How It Works · Data refreshed daily, snapshot 2026-09-05.