Llama 2 70B Chat GPTQ — benchmark results

Provider: Meta. Released 2023-07-18. Access: Open.

Unified ELO 1323 ± 11, rank #1485 of 1776 rated models, from 69 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
MMLU-by-task - College Computer Science60Accuracy (%)99
MMLU-by-task - Jurisprudence83.33Accuracy (%)98.1
MMLU-by-task - US Foreign Policy88Accuracy (%)94.4
MMLU-by-task - Management81.55Accuracy (%)94.1
JustEval - Safety5Score (1-5)93.3
MMLU-by-task - High School US History86.27Accuracy (%)93.1
MMLU-by-task - Electrical Engineering57.93Accuracy (%)93
MMLU-by-task - Security Studies75.92Accuracy (%)92.7
MMLU-by-task - Astronomy73.03Accuracy (%)92.3
MMLU-by-task - College Medicine60.12Accuracy (%)92.3
MMLU-by-task - Sociology84.58Accuracy (%)92.3
MMLU-by-task - College Chemistry47Accuracy (%)92.1

Interactive version: theaggregate.ai/model?slug=llama-2-70b-chat-gptq · How the rankings work · Data refreshed daily, snapshot 2026-07-22.