Llama 2 7B: benchmark results

Provider: Meta. Released 2023-07-18. Access: Open.

Unified ELO 1333 ± 1, rank #1300 of 1392 rated models, from 76 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
HELM Classic - Synthetic Reasoning Natural26.02F1 (%)82.4
HELM Classic - bAbI54.97Exact Match (%)81.9
HELM Classic - QuAC40.62F1 (%)80
ToolBench - WebShop Short6.92Task Score79.1
HELM Classic - WikiFact33.49Exact Match (%)75.8
HELM Classic - Dyck65.8Exact Match (%)75
HELM Classic - Entity Matching85.07Exact Match (%)74.2
HELM Classic - MATH Chain-of-Thought9.91Equivalent (%)72.1
ToolBench - VirtualHome21.49Task Score69.8
HELM Classic - MMLU43.07Exact Match (%)68.2
HELM Classic - NaturalQuestions Closed Book33.66F1 (%)68.2
HELM Classic - NarrativeQA69.12F1 (%)67.7

Interactive version: theaggregate.ai/model?slug=llama-2-7b · How It Works · Data refreshed daily, snapshot 2026-09-05.