Llama-3-Instruct-8B-SimPO-SPPO-Iter3-merge: benchmark results

Provider: Meta. Released 2024-06-28. Access: Open.

Unified ELO 1505 ± 1, rank #668 of 1392 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - IFEval68.06Score80.7
Open Korean LLM Leaderboard40.21Average Score (%)73.3
Open Chinese LLM - TruthfulQA MC56.24Accuracy (%)67.4
Open Chinese LLM - GSM8K49.81Accuracy (%)66.5
Open LLM Leaderboard - MMLU-Pro29.83Score59.1
Open Chinese LLM - C-Eval Semantic69.64Accuracy (%)50.7
Open Chinese LLM Leaderboard56.64Average Score (%)50.4
Open LLM Leaderboard - BBH29.07Score48.6
Open Chinese LLM - CMMLU52.97Accuracy (%)45.7
Open LLM Leaderboard - MATH Level 58.91Score43.9
Open Chinese LLM - ARC Challenge50.6Accuracy (%)43
Open LLM Leaderboard - MuSR6.7Score31.8

Interactive version: theaggregate.ai/model?slug=llama-3-instruct-8b-simpo-sppo-iter3-merge · How It Works · Data refreshed daily, snapshot 2026-09-05.