Llama 2 70B Chat (HF) — benchmark results

Provider: Meta. Released 2023-07-18. Access: Open.

Unified ELO 1382 ± 14, rank #1303 of 1776 rated models, from 248 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Japanese LLM - Xlsum JA Bleu JA78.31Score (%)99.5
MMLU-by-task - College Computer Science59Accuracy (%)98.1
MMLU-by-task - Jurisprudence82.41Accuracy (%)96
MMLU-by-task - Security Studies78.78Accuracy (%)96
MMLU-by-task - Sociology87.06Accuracy (%)94.8
MMLU-by-task - College Chemistry48Accuracy (%)94
MMLU-by-task - High School European History81.82Accuracy (%)93.7
MMLU-by-task - High School Physics42.38Accuracy (%)93.6
MMLU-by-task - US Foreign Policy87Accuracy (%)93.2
MMLU-by-task - Electrical Engineering57.93Accuracy (%)93
MMLU-by-task - Miscellaneous82.76Accuracy (%)93
MMLU-by-task - College Biology75Accuracy (%)92.8

Interactive version: theaggregate.ai/model?slug=llama-2-70b-chat-hf · How the rankings work · Data refreshed daily, snapshot 2026-07-22.