Llama-3-Base-8B-SFT-ORPO — benchmark results

Princeton NLP's ORPO baseline on its Llama 3 8B SFT base, released with the SimPO paper's baseline suite. Provider: Meta. Released 2024-05-17. Access: Open.

Unified ELO 1413 ± 31, rank #1167 of 1776 rated models, from 7 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM Leaderboard494.81Average Score (%)87
Open LLM Leaderboard - GPQA8.5Score70.7
Open LLM Leaderboard - IFEval45.17Score49.8
Open LLM Leaderboard - BBH26.49Score41.5
Open LLM Leaderboard - MMLU-Pro23.14Score39.3
Open LLM Leaderboard - MuSR7.63Score35.6
Open LLM Leaderboard - MATH Level 54.68Score26.5

Interactive version: theaggregate.ai/model?slug=llama-3-base-8b-sft-orpo · How the rankings work · Data refreshed daily, snapshot 2026-07-22.