LLaMA-65B — benchmark results

Provider: Meta. Released 2023-02-24. Access: Open.

Unified ELO 1353 ± 11, rank #1400 of 1776 rated models, from 129 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
ToolBench - WebShop Short41.2Task Score100
MMLU-by-task - Computer Security79Accuracy (%)99.2
MMLU-by-task - Public Relations74.55Accuracy (%)99.1
HELM Classic - IMDB96.2Exact Match (%)98.5
HELM Classic - NarrativeQA75.49F1 (%)98.5
HELM Classic - NaturalQuestions Closed Book43.14F1 (%)98.5
HELM Classic - WikiFact42.08Exact Match (%)98.5
HELM90.83Mean win rate (self-reported)98.4
MMLU-by-task - High School Statistics60.65Accuracy (%)98.1
HELM Classic - MMLU58.37Exact Match (%)97
MMLU-by-task - Virology54.22Accuracy (%)96.7
MMLU-by-task - Management82.52Accuracy (%)96.4

Interactive version: theaggregate.ai/model?slug=llama-65b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.