Llama-3-Instruct-8B-SPPO-Iter3-SimPO-merge — benchmark results

Community SLERP merge by grimjim of UCLA-AGI's SPPO Iter3 and Princeton NLP's SimPO fine-tunes of Llama 3 8B Instruct. Provider: Meta. Released 2024-06-28. Access: Open.

Unified ELO 1405 ± 8, rank #1199 of 1776 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM Leaderboard406.17Average Score (%)78
Open Chinese LLM - TruthfulQA MC56.61Accuracy (%)70.9
Open Chinese LLM - GSM8K48.6Accuracy (%)62.3
Open LLM Leaderboard - MMLU-Pro29.17Score56
Open Chinese LLM - C-Eval Semantic69.53Accuracy (%)50.4
Open Chinese LLM Leaderboard56.57Average Score (%)48.7
Open LLM Leaderboard - MATH Level 59.97Score47.3
Open LLM Leaderboard - MuSR9.54Score46.6
Open LLM Leaderboard - BBH28.26Score46.1
Open Chinese LLM - ARC Challenge51.11Accuracy (%)45
Open LLM Leaderboard - GPQA5.37Score44.9
Open Chinese LLM - CMMLU52.88Accuracy (%)44.8

Interactive version: theaggregate.ai/model?slug=llama-3-instruct-8b-sppo-iter3-simpo-merge · How the rankings work · Data refreshed daily, snapshot 2026-07-22.