Llama 3 8B ProLong 512k Instruct — benchmark results

Princeton NLP's ProLong 512K, extending Llama 3 8B Instruct to a 512K context via 40B tokens of continued training plus UltraChat SFT. Provider: Meta. Released 2024-08-22. Access: Open.

Unified ELO 1404 ± 10, rank #1205 of 1776 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM Leaderboard451.44Average Score (%)82.8
Open LLM Leaderboard - MuSR12.53Score68.6
Open LLM Leaderboard - IFEval55.08Score66.5
Open LLM Leaderboard - BBH29.15Score48.7
Open Chinese LLM - TruthfulQA MC53.45Accuracy (%)48.1
Open LLM Leaderboard - MMLU-Pro24.96Score44.7
Open Chinese LLM - ARC Challenge50.09Accuracy (%)41.4
Open LLM Leaderboard - GPQA4.81Score41
Open Chinese LLM - CMMLU51.79Accuracy (%)40.4
Open Chinese LLM - GSM8K40.86Accuracy (%)40.2
Open Chinese LLM - C-Eval Semantic64.65Accuracy (%)37.7
Open Chinese LLM - HellaSwag57.65Accuracy (%)33.8

Interactive version: theaggregate.ai/model?slug=llama-3-8b-prolong-512k-instruct · How the rankings work · Data refreshed daily, snapshot 2026-07-22.