Llama 3 8B — benchmark results
Provider: Meta. Released 2024-04-18. Access: Open.
Unified ELO 1348 ± 15, rank #1421 of 1776 rated models, from 229 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| EuroEval Portuguese NLU - MultiWikiQA PT | 77.31 | Reading comprehension Score (%) | 93.8 |
| EuroEval Finnish NLU - Tydiqa FI | 74.51 | Reading comprehension Score (%) | 92.5 |
| EuroEval Dutch NLU - DBRD | 91.87 | Sentiment classification Score (%) | 90.2 |
| MixRea | 18.3 | Implicit Information Ignorance Rate (I3R) (self-reported) | 90 |
| EuroEval Finnish NLU - Scandisent FI | 92.2 | Sentiment classification Score (%) | 88.3 |
| EuroEval French NLU - FQuAD | 72.66 | Reading comprehension Score (%) | 87.4 |
| EuroEval Spanish NLU - MLQA ES | 65.7 | Reading comprehension Score (%) | 85.8 |
| Open Medical LLM - MMLU Medical Genetics | 83 | Accuracy (%) | 85.8 |
| LIBRA - LibrusecMHQA | 46.09 | Dataset Total Score (%) | 85.7 |
| Open Medical LLM - MedMCQA | 57.47 | Accuracy (%) | 83.8 |
| Open Medical LLM - MMLU Anatomy | 68.89 | Accuracy (%) | 83.5 |
| IFEval Leaderboard | 78.84 | Final Score | 80 |
Interactive version: theaggregate.ai/model?slug=llama-3-8b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.