Llama 3.1 8B Instruct — benchmark results

Meta Llama 3.1 8B instruction-tuned checkpoint. Provider: Meta. Released 2024-07-23. Access: Open.

Unified ELO 1437 ± 5, rank #1057 of 1776 rated models, from 1071 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AgentCollabBench10.1IDR (self-reported)100
LIBRA - MatreshkaYesNo75Dataset Total Score (%)100
MASLegalBench86.21Best accuracy (self-reported)100
Open CoT - LSAT Reading Comprehension27.51CoT Gain (%)100
EuroEval Serbian Summarization - LR SUM SR31.53Score (%)99.3
Open CoT Leaderboard16.29Average CoT Gain (%)98.5
EuroEval Bosnian Summarization - LR SUM BS32.19Score (%)98
EuroEval Dutch Summarization - Wiki Lingua NL36.04Score (%)98
EVALITA - evalita NER40.3CPS97.9
EuroEval Albanian Summarization - LR SUM SQ34.7Score (%)97.4
EuroEval Catalan Summarization - Dacsa CA39.33Score (%)97.4
LatamBoard - Spanish PAWS64.85Score (%)97

Interactive version: theaggregate.ai/model?slug=llama-3-1-8b-instruct · How the rankings work · Data refreshed daily, snapshot 2026-07-22.