Barcenas-14B-Phi-3-medium-ORPO — benchmark results
Danielbrdz's ORPO fine-tune of SauerkrautLM-Phi-3-medium (Phi-3 14B) on mlabonne's orpo-dpo-mix-40k for conversational use. Provider: Other. Released 2024-06-15. Access: Open.
Unified ELO 1481 ± 19, rank #870 of 1776 rated models, from 15 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - MuSR | 20.53 | Score | 95.7 |
| Open LLM Leaderboard - BBH | 51.03 | Score | 94 |
| Open Chinese LLM - GSM8K | 65.81 | Accuracy (%) | 90.2 |
| Open Chinese LLM - ARC Challenge | 59.73 | Accuracy (%) | 86.2 |
| Open LLM Leaderboard - MMLU-Pro | 41.37 | Score | 86 |
| Open Korean LLM Leaderboard | 483.43 | Average Score (%) | 85.7 |
| Open Chinese LLM Leaderboard | 65.55 | Average Score (%) | 81.6 |
| Open Chinese LLM - WinoGrande | 67.09 | Accuracy (%) | 81.3 |
| Open LLM Leaderboard - GPQA | 10.18 | Score | 78.8 |
| Open Chinese LLM - CMMLU | 64.76 | Accuracy (%) | 77.2 |
| Open Chinese LLM - C-Eval Semantic | 82.28 | Accuracy (%) | 72.4 |
| Open LLM Leaderboard - MATH Level 5 | 20.24 | Score | 71.3 |
Interactive version: theaggregate.ai/model?slug=barcenas-14b-phi-3-medium-orpo · How the rankings work · Data refreshed daily, snapshot 2026-07-22.