Barcenas-14B-Phi-3-medium-ORPO — benchmark results

Danielbrdz's ORPO fine-tune of SauerkrautLM-Phi-3-medium (Phi-3 14B) on mlabonne's orpo-dpo-mix-40k for conversational use. Provider: Other. Released 2024-06-15. Access: Open.

Unified ELO 1481 ± 19, rank #870 of 1776 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MuSR20.53Score95.7
Open LLM Leaderboard - BBH51.03Score94
Open Chinese LLM - GSM8K65.81Accuracy (%)90.2
Open Chinese LLM - ARC Challenge59.73Accuracy (%)86.2
Open LLM Leaderboard - MMLU-Pro41.37Score86
Open Korean LLM Leaderboard483.43Average Score (%)85.7
Open Chinese LLM Leaderboard65.55Average Score (%)81.6
Open Chinese LLM - WinoGrande67.09Accuracy (%)81.3
Open LLM Leaderboard - GPQA10.18Score78.8
Open Chinese LLM - CMMLU64.76Accuracy (%)77.2
Open Chinese LLM - C-Eval Semantic82.28Accuracy (%)72.4
Open LLM Leaderboard - MATH Level 520.24Score71.3

Interactive version: theaggregate.ai/model?slug=barcenas-14b-phi-3-medium-orpo · How the rankings work · Data refreshed daily, snapshot 2026-07-22.