Llama-3-Instruct-8B-ORPO-v0.2: benchmark results

Princeton NLP's ORPO preference-tuned Llama 3 8B Instruct, released as a baseline from the SimPO paper. Provider: Meta. Released 2024-07-06. Access: Open.

Unified ELO 1526 ± 1, rank #633 of 1553 rated models, from 7 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - IFEval76.33Score92
Open Korean LLM Leaderboard43.18Average Score (%)85.7
Open LLM Leaderboard - MMLU-Pro30.34Score61.5
Open LLM Leaderboard - BBH29.6Score50.2
Open LLM Leaderboard - MATH Level 510.2Score48
Open LLM Leaderboard - GPQA4.47Score38.5
Open LLM Leaderboard - MuSR4.85Score23.9

Interactive version: theaggregate.ai/model?slug=llama-3-instruct-8b-orpo-v0-2 · How It Works · Data refreshed daily, snapshot 2026-09-08.