Llama-3-Instruct-8B-SimPO-SPPO-Iter3-merge — benchmark results

Provider: Meta. Released 2024-06-28. Access: Open.

Unified ELO 1398 ± 22, rank #1237 of 1776 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM Leaderboard446.82Average Score (%)82.1
Open LLM Leaderboard - IFEval68.06Score80.7
Open Chinese LLM - TruthfulQA MC56.24Accuracy (%)67.4
Open Chinese LLM - GSM8K49.81Accuracy (%)66.5
Open LLM Leaderboard - MMLU-Pro29.83Score59.2
Open Chinese LLM - C-Eval Semantic69.64Accuracy (%)50.7
Open Chinese LLM Leaderboard56.64Average Score (%)50.4
Open LLM Leaderboard - BBH29.07Score48.6
Open Chinese LLM - CMMLU52.97Accuracy (%)45.7
Open LLM Leaderboard - MATH Level 58.91Score43.9
Open Chinese LLM - ARC Challenge50.6Accuracy (%)43
Open LLM Leaderboard - MuSR6.7Score31.8

Interactive version: theaggregate.ai/model?slug=llama-3-instruct-8b-simpo-sppo-iter3-merge · How the rankings work · Data refreshed daily, snapshot 2026-07-22.