Llama 2 13B — benchmark results

Provider: Meta. Released 2023-07-18. Access: Open.

Unified ELO 1329 ± 14, rank #1473 of 1776 rated models, from 72 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
HELM Classic - IMDB96.2Exact Match (%)98.5
HELM Classic - Entity Data Imputation84.36Exact Match (%)97.7
ToolBench - WebShop Short31.67Task Score97.7
HELM Classic - NarrativeQA74.4F1 (%)93.8
HELM Classic - LSAT23.48Exact Match (%)92.6
HELM Classic - WikiFact36.47Exact Match (%)90.9
ToolBench - WebShop Long0.6Task Score90.7
HELM82.3Mean win rate (self-reported)89.1
OpenEval - XSum30.43ROUGE-L88.9
OpenEval - CNN/DailyMail25.26ROUGE-L88.2
HELM Classic - bAbI58.39Exact Match (%)87
HELM Classic - MMLU50.67Exact Match (%)86.4

Interactive version: theaggregate.ai/model?slug=llama-2-13b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.