Llama-3-Instruct-8B-SPPO-Iter3 — benchmark results

Provider: Meta. Released 2024-06-25. Access: Open.

Unified ELO 1370 ± 27, rank #1343 of 1776 rated models, from 16 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - IFEval68.34Score81
Open Chinese LLM - GSM8K52.08Accuracy (%)71.2
Open Chinese LLM - TruthfulQA MC56.29Accuracy (%)68.8
Open LLM Leaderboard - MMLU-Pro29.53Score57.3
Open LLM Leaderboard - BBH29.74Score50.7
Open Chinese LLM Leaderboard56.62Average Score (%)50
Open Korean LLM Leaderboard74.13Average Score (%)48.8
Open Chinese LLM - C-Eval Semantic68.99Accuracy (%)47.9
Open Chinese LLM - CMMLU53.18Accuracy (%)47.8
Open LLM Leaderboard - MATH Level 59.59Score45.9
Open Chinese LLM - ARC Challenge49.57Accuracy (%)39.6
Ru Arena Hard47.45Win Rate (%)38.5

Interactive version: theaggregate.ai/model?slug=llama-3-instruct-8b-sppo-iter3 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.