Llama 3 8B ProLong 512k Base — benchmark results

Provider: Meta. Released 2024-08-22. Access: Open.

Unified ELO 1372 ± 18, rank #1336 of 1776 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM Leaderboard391.71Average Score (%)76.1
Open LLM Leaderboard - MuSR12.68Score69.5
Open LLM Leaderboard - IFEval53.22Score63.3
Open LLM Leaderboard - BBH29.85Score51.1
Open LLM Leaderboard - MMLU-Pro25.88Score46.9
Open Chinese LLM - CMMLU52.86Accuracy (%)44.5
Open Chinese LLM - WinoGrande62.19Accuracy (%)37.8
Open LLM Leaderboard - MATH Level 56.87Score36.9
Open Chinese LLM - C-Eval Semantic62.86Accuracy (%)32
Open Chinese LLM - GSM8K34.19Accuracy (%)28.5
Open Chinese LLM - HellaSwag56.14Accuracy (%)28.5
Open Chinese LLM - TruthfulQA MC51.27Accuracy (%)26.7

Interactive version: theaggregate.ai/model?slug=llama-3-8b-prolong-512k-base · How the rankings work · Data refreshed daily, snapshot 2026-07-22.