Llama-3-Instruct-8B-SimPO — benchmark results

Princeton NLP's Llama 3 8B Instruct preference-tuned with reference-free SimPO - the main checkpoint from the SimPO paper. Provider: Meta. Released 2024-05-17. Access: Open.

Unified ELO 1423 ± 27, rank #1114 of 1776 rated models, from 19 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - IFEval73.47Score88
BenchBench79.92Aggregate Score (%)84.6
AlpacaEval 2.044.65LC Win Rate (%)84.2
Open Chinese LLM - GSM8K49.43Accuracy (%)65
Open Chinese LLM - TruthfulQA MC55.75Accuracy (%)64.7
Open LLM Leaderboard - MMLU-Pro30.37Score61.7
Open Chinese LLM - C-Eval Semantic69.1Accuracy (%)48.7
Open LLM Leaderboard - GPQA5.82Score48.6
Open Korean LLM Leaderboard59.53Average Score (%)47.7
Open Chinese LLM - CMMLU53.1Accuracy (%)47.5
Open Chinese LLM Leaderboard56.34Average Score (%)46.1
Open LLM Leaderboard - BBH28.23Score46

Interactive version: theaggregate.ai/model?slug=llama-3-instruct-8b-simpo · How the rankings work · Data refreshed daily, snapshot 2026-07-22.