Llama 3.1 70B — benchmark results

Meta Llama 3.1 70B model row. Provider: Meta. Released 2024-07-23. Access: Open.

Unified ELO 1548 ± 9, rank #623 of 1776 rated models, from 414 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
EuroEval German NLU65.97NLU Average Score (%)100
EuroEval Greek NLU - MultiWikiQA EL76.53Reading comprehension Score (%)100
EuroEval Greek Summarization - Greek Wikipedia36.77Score (%)100
EuroEval Hungarian NLU65.84NLU Average Score (%)100
SeaEval - Cross-Lingual Consistency - Cross-LogiQA (Few-Shot)62.42Accuracy (%)100
SeaEval - Cross-Lingual Consistency - Cross-MMLU (Few-Shot)74Accuracy (%)100
SeaEval - Cross-Lingual Consistency - Cross-XQuAD (Few-Shot)95.88Accuracy (%)100
SeaEval - Cultural Reasoning - CN-Eval (Few-Shot)59.05Accuracy (%)100
SeaEval - Cultural Reasoning - PH-Eval (Few-Shot)66Accuracy (%)100
SeaEval - Cultural Reasoning - SG-Eval (Few-Shot)74.76Accuracy (%)100
SeaEval - Cultural Reasoning - SG-Eval v1 Cleaned (Few-Shot)77.94Accuracy (%)100
SeaEval - Cultural Reasoning - US-Eval (Few-Shot)86.92Accuracy (%)100

Interactive version: theaggregate.ai/model?slug=llama-3-1-70b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.