Llama 3.1 405B — benchmark results
Meta's largest open-weights Llama 3.1 model, a 405B dense frontier-class flagship with a 128K context (July 2024). Provider: Meta. Released 2024-07-23. Access: Open.
Unified ELO 1591 ± 12, rank #500 of 1776 rated models, from 168 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| CRMArena - MTA | 86.9 | MTA Score (%) | 100 |
| CRMArena - NCR | 81.5 | NCR Score (%) | 100 |
| EuroEval Dutch | 78.43 | Average Score (%) | 100 |
| EuroEval Dutch NLU | 80.98 | NLU Average Score (%) | 100 |
| EuroEval English | 79.72 | Average Score (%) | 100 |
| EuroEval Norwegian NLU - Norquad | 79.66 | Reading comprehension Score (%) | 99.7 |
| EuroEval French NLU - FQuAD | 77.36 | Reading comprehension Score (%) | 99.5 |
| EuroEval Finnish NLU | 70.61 | NLU Average Score (%) | 99.2 |
| EuroEval Norwegian NLU | 71.97 | NLU Average Score (%) | 99 |
| EuroEval Spanish NLU - MLQA ES | 70.79 | Reading comprehension Score (%) | 99 |
| EuroEval German NLU - Germanquad | 69.43 | Reading comprehension Score (%) | 98.8 |
| WinoGrande | 89.2 | Accuracy (%) | 98.8 |
Interactive version: theaggregate.ai/model?slug=llama-3-1-405b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.