Llama 2 70B — benchmark results

Provider: Meta. Released 2023-07-18. Access: Open.

Unified ELO 1395 ± 17, rank #1249 of 1776 rated models, from 58 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
HELM94.35Mean win rate (self-reported)100
HELM Classic - NarrativeQA76.99F1 (%)100
HELM Classic - NaturalQuestions Closed Book45.84F1 (%)100
HELM Classic - WikiFact44.92Exact Match (%)100
HELM Classic - bAbI70.53Exact Match (%)100
LLM Benchmarker Suite62.53Average Score (%)100
OpenEval - CNN/DailyMail25.62ROUGE-L100
OpenEval - XSum33.64ROUGE-L100
HELM Classic - BoolQ88.6Exact Match (%)98.5
ToolBench - VirtualHome24.74Task Score97.7
OpenEval - BoolQ87.5Exact Match (%)97.6
HELM Classic - IMDB96.1Exact Match (%)95.5

Interactive version: theaggregate.ai/model?slug=llama-2-70b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.