Llama 2 7B — benchmark results

Provider: Meta. Released 2023-07-18. Access: Open.

Unified ELO 1285 ± 12, rank #1565 of 1776 rated models, from 92 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
OpenEval - CNN/DailyMail25.28ROUGE-L94.1
LIBRA - LongContextMultiQ7.92Dataset Total Score (%)89.3
OpenEval - BoolQ84.38Exact Match (%)83.3
HELM Classic - Synthetic Reasoning Natural26.02F1 (%)82.4
HELM Classic - bAbI54.97Exact Match (%)81.9
HELM Classic - QuAC40.62F1 (%)80
ToolBench - WebShop Short6.92Task Score79.1
LIBRA - ruBABILongQA316.31Dataset Total Score (%)78.6
HELM Classic - WikiFact33.49Exact Match (%)75.8
HELM Classic - Dyck65.8Exact Match (%)75
HELM Classic - Entity Matching85.07Exact Match (%)74.2
OpenEval - XSum26.07ROUGE-L72.2

Interactive version: theaggregate.ai/model?slug=llama-2-7b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.