Llama 3.1 405B: benchmark results
Meta's largest open-weights Llama 3.1 model, a 405B dense frontier-class flagship with a 128K context (July 2024). Provider: Meta. Released 2024-07-23. Access: Open.
Unified ELO 1572 ± 1, rank #350 of 1392 rated models, from 175 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| CRMArena - MTA | 86.9 | MTA Score (%) | 100 |
| CRMArena - NCR | 81.5 | NCR Score (%) | 100 |
| EuroEval Dutch | 78.43 | Average Score (%) | 100 |
| EuroEval Dutch NLU | 80.98 | NLU Average Score (%) | 100 |
| EuroEval English | 79.72 | Average Score (%) | 100 |
| EuroEval Norwegian NLU - Norquad | 79.66 | Reading comprehension Score (%) | 99.7 |
| EuroEval French NLU - FQuAD | 77.36 | Reading comprehension Score (%) | 99.5 |
| ARC Challenge (AI2) | 95.3 | Accuracy (%) | 99.3 |
| EuroEval Finnish NLU | 70.61 | NLU Average Score (%) | 99.2 |
| EuroEval Norwegian NLU | 71.97 | NLU Average Score (%) | 99 |
| EuroEval Spanish NLU - MLQA ES | 70.79 | Reading comprehension Score (%) | 99 |
| EuroEval German NLU - Germanquad | 69.43 | Reading comprehension Score (%) | 98.8 |
Interactive version: theaggregate.ai/model?slug=llama-3-1-405b · How It Works · Data refreshed daily, snapshot 2026-09-05.