Llama 3.1 Nemotron 70B Instruct: benchmark results

NVIDIA's RLHF-tuned Llama 3.1 70B (HelpSteer2-Preference + REINFORCE), topping Arena Hard and AlpacaEval 2 at release (October 2024). Provider: NVIDIA. Released 2024-10-15. Access: Open.

Unified ELO 1526 ± 1, rank #560 of 1392 rated models, from 259 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
EuroEval Portuguese68.25Average Score (%)97.7
Open Japanese LLM - MMLU EN Exact Match81.23Score (%)97.6
Open Japanese LLM - Jsick Exact Match86.62Score (%)97.1
Open CoT - LSAT Logical Reasoning21.96CoT Gain (%)96.9
Open PL LLM - Generative69.13Average Generative Score (%)96.9
StickToYourRole80.66Cardinal Score96.8
Open Japanese LLM - Wikicorpus E TO J Bleu JA16.75Score (%)95.9
Thai LLM NLG - xl_sum_tha_seacrowd_t2t (ROUGE1)34.87ROUGE195.5
Enkrypt AI - Bias Risk45.74Risk Score94.7
Thai LLM NLU - belebele_tha_thai_seacrowd_qa88.33Accuracy (%)94.2
EuroEval Finnish NLU - Scandisent FI92.66Sentiment classification Score (%)94.1
Open Japanese LLM - Wiki Coreference SET F19.84Score (%)94

Interactive version: theaggregate.ai/model?slug=llama-3-1-nemotron-70b-instruct · How It Works · Data refreshed daily, snapshot 2026-09-05.