Llama-3-Instruct-8B-CPO-SimPO — benchmark results

Haoran Xu's CPO-SimPO fine-tune of Llama 3 8B Instruct, combining contrastive preference optimization with SimPO's length-normalized objective. Provider: Meta. Released 2024-06-19. Access: Open.

Unified ELO 1409 ± 22, rank #1178 of 1776 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM Leaderboard503.22Average Score (%)87.7
Open LLM Leaderboard - IFEval70.46Score83.6
Open Chinese LLM - TruthfulQA MC55.28Accuracy (%)62.3
Open Chinese LLM - GSM8K47.92Accuracy (%)60.4
Open LLM Leaderboard - MMLU-Pro29.84Score59.3
Open LLM Leaderboard - BBH29.76Score50.8
Open LLM Leaderboard - MATH Level 510.27Score48.3
Open LLM Leaderboard - GPQA5.7Score47.8
Open Chinese LLM - C-Eval Semantic68.28Accuracy (%)45.4
Open Chinese LLM - CMMLU52.94Accuracy (%)45.4
Open Chinese LLM Leaderboard55.84Average Score (%)41.8
Open Chinese LLM - ARC Challenge49.66Accuracy (%)40.2

Interactive version: theaggregate.ai/model?slug=llama-3-instruct-8b-cpo-simpo · How the rankings work · Data refreshed daily, snapshot 2026-07-22.