Llama-3-Instruct-8B-SPPO-Iter3-SimPO-merge: benchmark results

Community SLERP merge by grimjim of UCLA-AGI's SPPO Iter3 and Princeton NLP's SimPO fine-tunes of Llama 3 8B Instruct. Provider: Meta. Released 2024-06-28. Access: Open.

Unified ELO 1489 ± 1, rank #742 of 1392 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - TruthfulQA MC56.61Accuracy (%)70.9
Open Korean LLM Leaderboard39.39Average Score (%)68.5
Open Chinese LLM - GSM8K48.6Accuracy (%)62.3
Open LLM Leaderboard - MMLU-Pro29.17Score55.9
Open Chinese LLM - C-Eval Semantic69.53Accuracy (%)50.4
Open Chinese LLM Leaderboard56.57Average Score (%)48.7
Open LLM Leaderboard - MATH Level 59.97Score47.3
Open LLM Leaderboard - MuSR9.54Score46.6
Open LLM Leaderboard - BBH28.26Score46.1
Open Chinese LLM - ARC Challenge51.11Accuracy (%)45
Open LLM Leaderboard - GPQA5.37Score45
Open Chinese LLM - CMMLU52.88Accuracy (%)44.8

Interactive version: theaggregate.ai/model?slug=llama-3-instruct-8b-sppo-iter3-simpo-merge · How It Works · Data refreshed daily, snapshot 2026-09-05.