Llama 3 70B Instruct: benchmark results
Meta Llama 3 70B instruction-tuned checkpoint. Provider: Meta. Released 2024-04-18. Access: Open.
Unified ELO 1517 ± 1, rank #614 of 1392 rated models, from 577 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| NVIDIA LLM Robustness - AGIEval Consistency | 83.13 | Consistency (%) | 100 |
| NVIDIA LLM Robustness - MMLU-Pro Consistency | 75.24 | Consistency (%) | 100 |
| Open CoT - LSAT Logical Reasoning | 22.75 | CoT Gain (%) | 98.5 |
| Open LLM Leaderboard - IFEval | 80.99 | Score | 98.4 |
| Enkrypt AI - Toxicity Risk | 0 | Risk Score | 98.3 |
| Science Leaderboard | 61.9 | Average Accuracy (%) | 97 |
| BiGGen-Bench | 4.01 | Average Score (1-5) | 95.1 |
| Open Japanese LLM - Wikicorpus J TO E Comet Wmt22 | 76.85 | Score (%) | 94.4 |
| EuroEval Danish Knowledge | 92.24 | Knowledge Average Score (%) | 94 |
| Open CoT - LogiQA 2 | 15.08 | CoT Gain (%) | 93.9 |
| HELM EWoK - Agent Properties | 92.68 | EM | 92.9 |
| Open CoT - LogiQA | 9.11 | CoT Gain (%) | 92.4 |
Interactive version: theaggregate.ai/model?slug=llama-3-70b-instruct · How It Works · Data refreshed daily, snapshot 2026-09-05.