LLaMA-30B — benchmark results

Provider: Meta. Released 2023-04-04. Access: Open.

Unified ELO 1301 ± 17, rank #1533 of 1776 rated models, from 101 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
HELM Classic - LegalSupport63.8Exact Match (%)98.5
HELM Classic - Entity Data Imputation84.36Exact Match (%)97.7
HELM Classic - RAFT75.23Exact Match (%)97
HELM Classic - NarrativeQA75.25F1 (%)96.9
HELM Classic - NaturalQuestions Closed Book40.83F1 (%)95.5
ToolBench - WebShop Short30.6Task Score95.3
HELM Classic - bAbI63.36Exact Match (%)92.8
MMLU-by-task - Public Relations70Accuracy (%)92
HELM Classic - Entity Matching90.83Exact Match (%)90.9
MMLU-by-task - Medical Genetics66Accuracy (%)90
HELM Classic - BoolQ86.1Exact Match (%)89.4
HELM Classic - MMLU53.14Exact Match (%)89.4

Interactive version: theaggregate.ai/model?slug=llama-30b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.