Llama 2 13B: benchmark results

Provider: Meta. Released 2023-07-18. Access: Open.

Unified ELO 1375 ± 1, rank #1205 of 1392 rated models, from 67 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
HELM Classic - IMDB96.2Exact Match (%)98.5
HELM Classic - Entity Data Imputation84.36Exact Match (%)97.7
ToolBench - WebShop Short31.67Task Score97.7
HELM Classic - NarrativeQA74.4F1 (%)93.8
HELM Classic - LSAT23.48Exact Match (%)92.6
HELM Classic - WikiFact36.47Exact Match (%)90.9
ToolBench - WebShop Long0.6Task Score90.7
HELM82.3Mean win rate (self-reported)89.2
HELM Classic - bAbI58.39Exact Match (%)87
HELM Classic - MMLU50.67Exact Match (%)86.4
HELM Classic - RAFT70.68Exact Match (%)85.6
HELM Classic - QuAC42.38F1 (%)84.6

Interactive version: theaggregate.ai/model?slug=llama-2-13b · How It Works · Data refreshed daily, snapshot 2026-09-05.