Llama 3 70B Instruct: benchmark results

Meta Llama 3 70B instruction-tuned checkpoint. Provider: Meta. Released 2024-04-18. Access: Open.

Unified ELO 1517 ± 1, rank #614 of 1392 rated models, from 577 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
NVIDIA LLM Robustness - AGIEval Consistency83.13Consistency (%)100
NVIDIA LLM Robustness - MMLU-Pro Consistency75.24Consistency (%)100
Open CoT - LSAT Logical Reasoning22.75CoT Gain (%)98.5
Open LLM Leaderboard - IFEval80.99Score98.4
Enkrypt AI - Toxicity Risk0Risk Score98.3
Science Leaderboard61.9Average Accuracy (%)97
BiGGen-Bench4.01Average Score (1-5)95.1
Open Japanese LLM - Wikicorpus J TO E Comet Wmt2276.85Score (%)94.4
EuroEval Danish Knowledge92.24Knowledge Average Score (%)94
Open CoT - LogiQA 215.08CoT Gain (%)93.9
HELM EWoK - Agent Properties92.68EM92.9
Open CoT - LogiQA9.11CoT Gain (%)92.4

Interactive version: theaggregate.ai/model?slug=llama-3-70b-instruct · How It Works · Data refreshed daily, snapshot 2026-09-05.