Llama 3 70B Instruct — benchmark results

Meta Llama 3 70B instruction-tuned checkpoint. Provider: Meta. Released 2024-04-18. Access: Open.

Unified ELO 1520 ± 7, rank #721 of 1776 rated models, from 563 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
NVIDIA LLM Robustness - AGIEval Consistency83.13Consistency (%)100
NVIDIA LLM Robustness - MMLU-Pro Consistency75.24Consistency (%)100
Open CoT - LSAT Logical Reasoning22.75CoT Gain (%)98.5
Open LLM Leaderboard - IFEval80.99Score98.4
Science Leaderboard61.9Average Accuracy (%)97
BiGGen-Bench4.01Average Score (1-5)95.1
Open Japanese LLM - Wikicorpus J TO E Comet Wmt2276.85Score (%)94.4
EuroEval Danish Knowledge92.24Knowledge Average Score (%)94
Open CoT - LogiQA 215.08CoT Gain (%)93.9
HELM EWoK - Agent Properties92.68EM92.9
Open CoT - LogiQA9.11CoT Gain (%)92.4
Open CoT Leaderboard13.98Average CoT Gain (%)92.4

Interactive version: theaggregate.ai/model?slug=llama-3-70b-instruct · How the rankings work · Data refreshed daily, snapshot 2026-07-22.