Llama-3-Base-8B-SFT-SLiC-HF — benchmark results

Princeton NLP's SLiC-HF baseline on its Llama 3 8B SFT base, part of the SimPO paper's preference-optimization baseline suite. Provider: Meta. Released 2024-07-06. Access: Open.

Unified ELO 1417 ± 23, rank #1146 of 1776 rated models, from 7 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM Leaderboard537.93Average Score (%)91.4
Open LLM Leaderboard - IFEval48.9Score57.1
Open LLM Leaderboard - MuSR10.27Score51.3
Open LLM Leaderboard - GPQA4.92Score41.7
Open LLM Leaderboard - BBH26.37Score41.2
Open LLM Leaderboard - MMLU-Pro22.93Score38.6
Open LLM Leaderboard - MATH Level 55.06Score28.2

Interactive version: theaggregate.ai/model?slug=llama-3-base-8b-sft-slic-hf · How the rankings work · Data refreshed daily, snapshot 2026-07-22.