Llama-3.1-Tulu-3-70B: benchmark results

Provider: Meta. Released 2024-11-21. Access: Open.

Unified ELO 1637 ± 20, rank #496 of 2656 rated models, from 178 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AbstentionBench - answer unknown - KUQ/Future unknowns - F185.29Abstention F1 (%)100
EVALITA - summarization-fanpage35.46CPS100
Open Japanese LLM - Wikicorpus J TO E Comet Wmt2277.96Score (%)99.5
Open LLM Leaderboard - IFEval83.79Score99.4
Open Japanese LLM - Wikicorpus J TO E Bert Score EN F191.88Score (%)99.3
Open Japanese LLM - Mbpp Pylint Check99.2Score (%)98.9
Open Japanese LLM - MT86.05Score (%)98.3
Open Japanese LLM - Wikicorpus J TO E Bleu EN13.1Score (%)98.3
Open Japanese LLM - Xlsum JA Bert Score JA F176.74Score (%)98.3
Open Japanese LLM - Xlsum JA Rouge147.5Score (%)98.3
Open Japanese LLM - SUM22.03Score (%)98.1
Open Japanese LLM - Xlsum JA Rouge221.99Score (%)98.1

Interactive version: theaggregate.ai/model?slug=llama-3-1-tulu-3-70b · How It Works · Data refreshed daily, snapshot 2026-09-19.