Phi-3.5-MoE-instruct: benchmark results
Microsoft's 42B mixture-of-experts Phi, activating 6.6B parameters across 16 experts, with a 128K context under MIT license (August 2024). Provider: Microsoft. Released 2024-08-23. Access: Open.
Unified ELO 1512 ± 1, rank #639 of 1392 rated models, from 63 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| LLM Stats (Social IQa) | 78 | Score (%) | 100 |
| PIQA | 88.6 | Accuracy (%) | 96.7 |
| Open CoT - LogiQA 2 | 15.14 | CoT Gain (%) | 94.7 |
| AILuminate Safety | 4 | Safety Grade (1-5) | 91.9 |
| Open CoT - LogiQA | 8.47 | CoT Gain (%) | 91.6 |
| Enkrypt AI - Safety Risk | 18.44 | Risk Score | 91.2 |
| GSM8K | 88.7 | Accuracy (%) | 90.9 |
| Open LLM Leaderboard - GPQA | 14.09 | Score | 89.6 |
| Open LLM Leaderboard - BBH | 48.77 | Score | 89.3 |
| Open LLM Leaderboard - MuSR | 17.33 | Score | 88.5 |
| Open CoT Leaderboard | 13.08 | Average CoT Gain (%) | 87 |
| Open CoT - LSAT Analytical Reasoning | 7.83 | CoT Gain (%) | 86.3 |
Interactive version: theaggregate.ai/model?slug=phi-3-5-moe-instruct · How It Works · Data refreshed daily, snapshot 2026-09-05.