Barcenas-14B-Phi-3-medium-ORPO: benchmark results
Danielbrdz's ORPO fine-tune of SauerkrautLM-Phi-3-medium (Phi-3 14B) on mlabonne's orpo-dpo-mix-40k for conversational use. Provider: Other. Released 2024-06-15. Access: Open.
Unified ELO 1551 ± 1, rank #431 of 1392 rated models, from 15 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - MuSR | 20.53 | Score | 95.7 |
| Open LLM Leaderboard - BBH | 51.03 | Score | 94 |
| Open Chinese LLM - GSM8K | 65.81 | Accuracy (%) | 90.2 |
| Open Chinese LLM - ARC Challenge | 59.73 | Accuracy (%) | 86.2 |
| Open LLM Leaderboard - MMLU-Pro | 41.37 | Score | 86 |
| Open Chinese LLM Leaderboard | 65.55 | Average Score (%) | 81.6 |
| Open Chinese LLM - WinoGrande | 67.09 | Accuracy (%) | 81.3 |
| Open LLM Leaderboard - GPQA | 10.18 | Score | 78.8 |
| Open Chinese LLM - CMMLU | 64.76 | Accuracy (%) | 77.2 |
| Open Chinese LLM - C-Eval Semantic | 82.28 | Accuracy (%) | 72.4 |
| Open LLM Leaderboard - MATH Level 5 | 20.24 | Score | 71.3 |
| Open Chinese LLM - HellaSwag | 62.83 | Accuracy (%) | 70.5 |
Interactive version: theaggregate.ai/model?slug=barcenas-14b-phi-3-medium-orpo · How It Works · Data refreshed daily, snapshot 2026-09-05.