Llama 2 70B Chat — benchmark results

Chat-tuned Llama 2 70B checkpoint. Provider: Meta. Released 2023-07-18. Access: Open.

Unified ELO 1302 ± 24, rank #1530 of 1776 rated models, from 103 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
MMLU-by-task - International Law89.26Accuracy (%)99.9
MMLU-by-task - Formal Logic55.56Accuracy (%)99.8
MMLU-by-task - High School World History90.72Accuracy (%)99.8
MMLU-by-task - High School Physics49.67Accuracy (%)99.6
MMLU-by-task - Machine Learning59.82Accuracy (%)99.6
MMLU-by-task - Management84.47Accuracy (%)99.5
MMLU-by-task - Marketing91.45Accuracy (%)99.4
MMLU-by-task - High School European History85.45Accuracy (%)99.2
MMLU-by-task - Public Relations74.55Accuracy (%)99.1
MMLU-by-task - Professional Accounting57.45Accuracy (%)99
MMLU-by-task - Professional Law56.65Accuracy (%)98.6
MMLU-by-task - High School Government And Politics94.3Accuracy (%)98.5

Interactive version: theaggregate.ai/model?slug=llama-2-70b-chat · How the rankings work · Data refreshed daily, snapshot 2026-07-22.