Llama-3.1-Tulu-3-70B: benchmark results
Provider: Meta. Released 2024-11-21. Access: Open.
Unified ELO 1637 ± 20, rank #496 of 2656 rated models, from 178 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AbstentionBench - answer unknown - KUQ/Future unknowns - F1 | 85.29 | Abstention F1 (%) | 100 |
| EVALITA - summarization-fanpage | 35.46 | CPS | 100 |
| Open Japanese LLM - Wikicorpus J TO E Comet Wmt22 | 77.96 | Score (%) | 99.5 |
| Open LLM Leaderboard - IFEval | 83.79 | Score | 99.4 |
| Open Japanese LLM - Wikicorpus J TO E Bert Score EN F1 | 91.88 | Score (%) | 99.3 |
| Open Japanese LLM - Mbpp Pylint Check | 99.2 | Score (%) | 98.9 |
| Open Japanese LLM - MT | 86.05 | Score (%) | 98.3 |
| Open Japanese LLM - Wikicorpus J TO E Bleu EN | 13.1 | Score (%) | 98.3 |
| Open Japanese LLM - Xlsum JA Bert Score JA F1 | 76.74 | Score (%) | 98.3 |
| Open Japanese LLM - Xlsum JA Rouge1 | 47.5 | Score (%) | 98.3 |
| Open Japanese LLM - SUM | 22.03 | Score (%) | 98.1 |
| Open Japanese LLM - Xlsum JA Rouge2 | 21.99 | Score (%) | 98.1 |
Interactive version: theaggregate.ai/model?slug=llama-3-1-tulu-3-70b · How It Works · Data refreshed daily, snapshot 2026-09-19.