Llama 3 70B Instruct — benchmark results
Meta Llama 3 70B instruction-tuned checkpoint. Provider: Meta. Released 2024-04-18. Access: Open.
Unified ELO 1520 ± 7, rank #721 of 1776 rated models, from 563 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| NVIDIA LLM Robustness - AGIEval Consistency | 83.13 | Consistency (%) | 100 |
| NVIDIA LLM Robustness - MMLU-Pro Consistency | 75.24 | Consistency (%) | 100 |
| Open CoT - LSAT Logical Reasoning | 22.75 | CoT Gain (%) | 98.5 |
| Open LLM Leaderboard - IFEval | 80.99 | Score | 98.4 |
| Science Leaderboard | 61.9 | Average Accuracy (%) | 97 |
| BiGGen-Bench | 4.01 | Average Score (1-5) | 95.1 |
| Open Japanese LLM - Wikicorpus J TO E Comet Wmt22 | 76.85 | Score (%) | 94.4 |
| EuroEval Danish Knowledge | 92.24 | Knowledge Average Score (%) | 94 |
| Open CoT - LogiQA 2 | 15.08 | CoT Gain (%) | 93.9 |
| HELM EWoK - Agent Properties | 92.68 | EM | 92.9 |
| Open CoT - LogiQA | 9.11 | CoT Gain (%) | 92.4 |
| Open CoT Leaderboard | 13.98 | Average CoT Gain (%) | 92.4 |
Interactive version: theaggregate.ai/model?slug=llama-3-70b-instruct · How the rankings work · Data refreshed daily, snapshot 2026-07-22.