Llama-3-Base-8B-SFT-ORPO: benchmark results

Princeton NLP's ORPO baseline on its Llama 3 8B SFT base, released with the SimPO paper's baseline suite. Provider: Meta. Released 2024-05-17. Access: Open.

Unified ELO 1491 ± 1, rank #822 of 1553 rated models, from 7 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM Leaderboard43.07Average Score (%)85.4
Open LLM Leaderboard - GPQA8.5Score70.7
Open LLM Leaderboard - IFEval45.17Score49.8
Open LLM Leaderboard - BBH26.49Score41.5
Open LLM Leaderboard - MMLU-Pro23.14Score39.3
Open LLM Leaderboard - MuSR7.63Score35.6
Open LLM Leaderboard - MATH Level 54.68Score26.5

Interactive version: theaggregate.ai/model?slug=llama-3-base-8b-sft-orpo · How It Works · Data refreshed daily, snapshot 2026-09-08.