NeuralLLaMa-3-8B-ORPO-v0.3 — benchmark results

Kukedlc's ORPO fine-tune of Llama 3 8B Instruct, preference-trained on mlabonne's orpo-dpo-mix-40k dataset. Provider: Other. Released 2024-05-01. Access: Open.

Unified ELO 1426 ± 38, rank #1102 of 1776 rated models, from 31 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open CoT - LogiQA 216.48CoT Gain (%)96.9
Open CoT - LogiQA10.22CoT Gain (%)95.4
Open CoT Leaderboard14.52Average CoT Gain (%)94.7
Open CoT - LSAT Logical Reasoning20.2CoT Gain (%)93.1
Open Medical LLM - MedMCQA58.52Accuracy (%)90.3
Open Medical LLM - PubMedQA77Accuracy (%)89.2
Open CoT - LSAT Reading Comprehension20.07CoT Gain (%)85.9
Open Medical LLM - MMLU College Biology79.86Accuracy (%)85.5
Open Medical LLM - MedQA (USMLE)61.19Accuracy (%)82.4
Open Medical LLM70.4Average Accuracy (%)79
Open Medical LLM - MMLU Professional Medicine74.26Accuracy (%)78.1
Open Medical LLM - MMLU Medical Genetics82Accuracy (%)77.8

Interactive version: theaggregate.ai/model?slug=neuralllama-3-8b-orpo-v0-3 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.