Llama 3.1 8B Instruct: benchmark results

Meta Llama 3.1 8B instruction-tuned checkpoint. Provider: Meta. Released 2024-07-23. Access: Open.

Unified ELO 1446 ± 1, rank #960 of 1392 rated models, from 1124 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AgentCollabBench10.1IDR (self-reported)100
LIBRA - MatreshkaYesNo75Dataset Total Score (%)100
MASLegalBench86.21Best accuracy (self-reported)100
Open CoT - LSAT Reading Comprehension27.51CoT Gain (%)100
EuroEval Serbian Summarization - LR SUM SR31.53Score (%)99.3
Open CoT Leaderboard16.29Average CoT Gain (%)98.5
Enkrypt AI - Toxicity Risk0Risk Score98.3
EuroEval Bosnian Summarization - LR SUM BS32.19Score (%)98
EuroEval Dutch Summarization - Wiki Lingua NL36.04Score (%)98
EVALITA - evalita NER40.3CPS97.9
EuroEval Albanian Summarization - LR SUM SQ34.7Score (%)97.4
EuroEval Catalan Summarization - Dacsa CA39.33Score (%)97.4

Interactive version: theaggregate.ai/model?slug=llama-3-1-8b-instruct · How It Works · Data refreshed daily, snapshot 2026-09-05.