Llama 2 70B Chat (HF): benchmark results

Provider: Meta. Released 2023-07-18. Access: Open.

Unified ELO 1420 ± 1, rank #1065 of 1392 rated models, from 254 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
MMLU-by-task - College Computer Science59Accuracy (%)98.1
MMLU-by-task - Jurisprudence82.41Accuracy (%)96
MMLU-by-task - Security Studies78.78Accuracy (%)96
MMLU-by-task - Sociology87.06Accuracy (%)94.8
MMLU-by-task - College Chemistry48Accuracy (%)94
MMLU-by-task - High School European History81.82Accuracy (%)93.7
MMLU-by-task - High School Physics42.38Accuracy (%)93.6
MMLU-by-task - US Foreign Policy87Accuracy (%)93.2
MMLU-by-task - Electrical Engineering57.93Accuracy (%)93
MMLU-by-task - Miscellaneous82.76Accuracy (%)93
MMLU-by-task - College Biology75Accuracy (%)92.8
MMLU-by-task - Econometrics41.23Accuracy (%)92.8

Interactive version: theaggregate.ai/model?slug=llama-2-70b-chat-hf · How It Works · Data refreshed daily, snapshot 2026-09-05.