Phi-3-mini-4K-instruct-cpo-simpo — benchmark results
Community CPO-SimPO preference-tuned variant of Microsoft's Phi-3 Mini 4K Instruct (3.8B), reported to improve GSM8K and TruthfulQA. Provider: Microsoft. Released 2024-06-24. Access: Open.
Unified ELO 1407 ± 10, rank #1190 of 1776 rated models, from 130 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - GPQA | 10.74 | Score | 80.7 |
| Open LLM Leaderboard - BBH | 39.15 | Score | 78.7 |
| Open Arabic LLM - Arabic MMLU HT Abstract Algebra | 33 | Accuracy (%) | 70.4 |
| Open LLM Leaderboard - IFEval | 57.14 | Score | 69 |
| Open LLM Leaderboard - MMLU-Pro | 31.78 | Score | 68.8 |
| Open Arabic LLM - Aratrust Offensive | 84.06 | Accuracy (%) | 63.4 |
| Open LLM Leaderboard - MATH Level 5 | 15.71 | Score | 63.3 |
| Open Arabic LLM - Arabic MMLU HT College Mathematics | 33 | Accuracy (%) | 60.2 |
| Open Arabic LLM - Arabic MMLU HT High School Mathematics | 30.37 | Accuracy (%) | 53.7 |
| Open Arabic LLM - Alghafa Multiple Choice Rating Sentiment NO Neutral Task | 76.34 | Accuracy (%) | 51.9 |
| Open Korean LLM Leaderboard | 74.88 | Average Score (%) | 48.9 |
| Open Arabic LLM - Alghafa Multiple Choice Rating Sentiment Task | 51.03 | Accuracy (%) | 46.3 |
Interactive version: theaggregate.ai/model?slug=phi-3-mini-4k-instruct-cpo-simpo · How the rankings work · Data refreshed daily, snapshot 2026-07-22.