Llama 2 70B Chat (HF) — benchmark results
Provider: Meta. Released 2023-07-18. Access: Open.
Unified ELO 1382 ± 14, rank #1303 of 1776 rated models, from 248 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open Japanese LLM - Xlsum JA Bleu JA | 78.31 | Score (%) | 99.5 |
| MMLU-by-task - College Computer Science | 59 | Accuracy (%) | 98.1 |
| MMLU-by-task - Jurisprudence | 82.41 | Accuracy (%) | 96 |
| MMLU-by-task - Security Studies | 78.78 | Accuracy (%) | 96 |
| MMLU-by-task - Sociology | 87.06 | Accuracy (%) | 94.8 |
| MMLU-by-task - College Chemistry | 48 | Accuracy (%) | 94 |
| MMLU-by-task - High School European History | 81.82 | Accuracy (%) | 93.7 |
| MMLU-by-task - High School Physics | 42.38 | Accuracy (%) | 93.6 |
| MMLU-by-task - US Foreign Policy | 87 | Accuracy (%) | 93.2 |
| MMLU-by-task - Electrical Engineering | 57.93 | Accuracy (%) | 93 |
| MMLU-by-task - Miscellaneous | 82.76 | Accuracy (%) | 93 |
| MMLU-by-task - College Biology | 75 | Accuracy (%) | 92.8 |
Interactive version: theaggregate.ai/model?slug=llama-2-70b-chat-hf · How the rankings work · Data refreshed daily, snapshot 2026-07-22.