Llama-3-Instruct-8B-SimPO-v0.2 — benchmark results

Princeton NLP's SimPO v0.2 fine-tune of Llama 3 8B Instruct, the updated release from the SimPO reference-free preference optimization paper. Provider: Meta. Released 2024-07-06. Access: Open.

Unified ELO 1420 ± 41, rank #1133 of 1776 rated models, from 8 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - IFEval68.09Score80.8
Open LLM Leaderboard - GPQA8.61Score71.4
Open LLM Leaderboard - MMLU-Pro29.84Score59.3
Open Korean LLM Leaderboard165.69Average Score (%)56.6
Open LLM Leaderboard - BBH29.21Score49
WildBench37.16WB Score Task-Macro46.8
Open LLM Leaderboard - MuSR8.39Score40.1
Open LLM Leaderboard - MATH Level 57.4Score38.9

Interactive version: theaggregate.ai/model?slug=llama-3-instruct-8b-simpo-v0-2 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.