Llama-3-Base-8B-SFT-RDPO — benchmark results

Princeton NLP's R-DPO baseline trained on their Llama 3 8B SFT base model, from the SimPO paper's base-model comparison setup. Provider: Meta. Released 2024-05-17. Access: Open.

Unified ELO 1435 ± 31, rank #1071 of 1776 rated models, from 7 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM Leaderboard593.3Average Score (%)93.4
Open LLM Leaderboard - GPQA7.49Score63.1
Open LLM Leaderboard - IFEval44.8Score49
Open LLM Leaderboard - MuSR8.91Score42.9
Open LLM Leaderboard - BBH25.53Score39.2
Open LLM Leaderboard - MMLU-Pro22.38Score36.8
Open LLM Leaderboard - MATH Level 55.74Score31.8

Interactive version: theaggregate.ai/model?slug=llama-3-base-8b-sft-rdpo · How the rankings work · Data refreshed daily, snapshot 2026-07-22.