Llama-3-Instruct-8B-DPO-v0.2 — benchmark results

Princeton NLP's DPO v0.2 baseline on Llama 3 8B Instruct, released with the SimPO paper's updated baseline suite. Provider: Meta. Released 2024-07-06. Access: Open.

Unified ELO 1426 ± 42, rank #1104 of 1776 rated models, from 7 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - IFEval72.08Score85.9
Open Korean LLM Leaderboard431.34Average Score (%)80.6
Open LLM Leaderboard - MMLU-Pro30.77Score63.6
Open LLM Leaderboard - BBH28.94Score48.2
Open LLM Leaderboard - MATH Level 58.99Score44.2
Open LLM Leaderboard - GPQA4.92Score41.7
Open LLM Leaderboard - MuSR5.56Score27

Interactive version: theaggregate.ai/model?slug=llama-3-instruct-8b-dpo-v0-2 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.