Llama-3-Instruct-8B-SimPO-v0.2: benchmark results

Princeton NLP's SimPO v0.2 fine-tune of Llama 3 8B Instruct, the updated release from the SimPO reference-free preference optimization paper. Provider: Meta. Released 2024-07-06. Access: Open.

Unified ELO 1501 ± 1, rank #686 of 1392 rated models, from 8 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - IFEval68.09Score80.7
Open Korean LLM Leaderboard41.38Average Score (%)79.5
Open LLM Leaderboard - GPQA8.61Score71.4
Open LLM Leaderboard - MMLU-Pro29.84Score59.3
Open LLM Leaderboard - BBH29.21Score48.9
WildBench37.16WB Score Task-Macro46.8
Open LLM Leaderboard - MuSR8.39Score40.1
Open LLM Leaderboard - MATH Level 57.4Score38.9

Interactive version: theaggregate.ai/model?slug=llama-3-instruct-8b-simpo-v0-2 · How It Works · Data refreshed daily, snapshot 2026-09-05.