Llama-3-Instruct-8B-ORPO-v0.2 — benchmark results

Princeton NLP's ORPO preference-tuned Llama 3 8B Instruct, released as a baseline from the SimPO paper. Provider: Meta. Released 2024-07-06. Access: Open.

Unified ELO 1447 ± 53, rank #1014 of 1776 rated models, from 7 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM Leaderboard555.82Average Score (%)92
Open LLM Leaderboard - IFEval76.33Score92
Open LLM Leaderboard - MMLU-Pro30.34Score61.5
Open LLM Leaderboard - BBH29.6Score50.2
Open LLM Leaderboard - MATH Level 510.2Score48
Open LLM Leaderboard - GPQA4.47Score38.5
Open LLM Leaderboard - MuSR4.85Score23.9

Interactive version: theaggregate.ai/model?slug=llama-3-instruct-8b-orpo-v0-2 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.