Llama 3.1 70B — benchmark results
Meta Llama 3.1 70B model row. Provider: Meta. Released 2024-07-23. Access: Open.
Unified ELO 1548 ± 9, rank #623 of 1776 rated models, from 414 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| EuroEval German NLU | 65.97 | NLU Average Score (%) | 100 |
| EuroEval Greek NLU - MultiWikiQA EL | 76.53 | Reading comprehension Score (%) | 100 |
| EuroEval Greek Summarization - Greek Wikipedia | 36.77 | Score (%) | 100 |
| EuroEval Hungarian NLU | 65.84 | NLU Average Score (%) | 100 |
| SeaEval - Cross-Lingual Consistency - Cross-LogiQA (Few-Shot) | 62.42 | Accuracy (%) | 100 |
| SeaEval - Cross-Lingual Consistency - Cross-MMLU (Few-Shot) | 74 | Accuracy (%) | 100 |
| SeaEval - Cross-Lingual Consistency - Cross-XQuAD (Few-Shot) | 95.88 | Accuracy (%) | 100 |
| SeaEval - Cultural Reasoning - CN-Eval (Few-Shot) | 59.05 | Accuracy (%) | 100 |
| SeaEval - Cultural Reasoning - PH-Eval (Few-Shot) | 66 | Accuracy (%) | 100 |
| SeaEval - Cultural Reasoning - SG-Eval (Few-Shot) | 74.76 | Accuracy (%) | 100 |
| SeaEval - Cultural Reasoning - SG-Eval v1 Cleaned (Few-Shot) | 77.94 | Accuracy (%) | 100 |
| SeaEval - Cultural Reasoning - US-Eval (Few-Shot) | 86.92 | Accuracy (%) | 100 |
Interactive version: theaggregate.ai/model?slug=llama-3-1-70b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.