Barcenas-Llama3-8B-ORPO — benchmark results

Danielbrdz's ORPO fine-tune of VAGO's Llama-3-SauerkrautLM-8B-Instruct, trained on the dolphin-sft-v0.1-preference dataset. Provider: Other. Released 2024-05-01. Access: Open.

Unified ELO 1439 ± 17, rank #1047 of 1776 rated models, from 25 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Medical LLM - PubMedQA77.6Accuracy (%)94
Open Korean LLM Leaderboard543.63Average Score (%)91.7
Open Medical LLM - MMLU College Biology81.25Accuracy (%)90.9
Open LLM Leaderboard - IFEval73.72Score88.3
Open Medical LLM - MMLU Medical Genetics83Accuracy (%)85.8
Open Medical LLM - MedQA (USMLE)60.88Accuracy (%)79.3
Open Medical LLM - MMLU Professional Medicine73.9Accuracy (%)76.4
Open Medical LLM69.93Average Accuracy (%)73.9
Open Chinese LLM - TruthfulQA MC57.52Accuracy (%)73.3
Open Medical LLM - MedMCQA56.68Accuracy (%)70.5
Open LLM Leaderboard - MMLU-Pro31.44Score67.1
Open LLM Leaderboard - GPQA7.61Score64.1

Interactive version: theaggregate.ai/model?slug=barcenas-llama3-8b-orpo · How the rankings work · Data refreshed daily, snapshot 2026-07-22.