Llama-3-Base-8B-SFT-RDPO: benchmark results

Princeton NLP's R-DPO baseline trained on their Llama 3 8B SFT base model, from the SimPO paper's base-model comparison setup. Provider: Meta. Released 2024-05-17. Access: Open.

Unified ELO 1507 ± 1, rank #732 of 1553 rated models, from 7 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM Leaderboard44.98Average Score (%)90.8
Open LLM Leaderboard - GPQA7.49Score63.2
Open LLM Leaderboard - IFEval44.8Score49
Open LLM Leaderboard - MuSR8.91Score42.8
Open LLM Leaderboard - BBH25.53Score39.2
Open LLM Leaderboard - MMLU-Pro22.38Score36.8
Open LLM Leaderboard - MATH Level 55.74Score31.8

Interactive version: theaggregate.ai/model?slug=llama-3-base-8b-sft-rdpo · How It Works · Data refreshed daily, snapshot 2026-09-08.