Llama 2 70B Chat: benchmark results
Chat-tuned Llama 2 70B checkpoint. Provider: Meta. Released 2023-07-18. Access: Open.
Unified ELO 1420 ± 1, rank #1066 of 1392 rated models, from 114 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| MMLU-by-task - International Law | 89.26 | Accuracy (%) | 99.9 |
| MMLU-by-task - Formal Logic | 55.56 | Accuracy (%) | 99.8 |
| MMLU-by-task - High School World History | 90.72 | Accuracy (%) | 99.8 |
| MMLU-by-task - High School Physics | 49.67 | Accuracy (%) | 99.6 |
| MMLU-by-task - Machine Learning | 59.82 | Accuracy (%) | 99.6 |
| MMLU-by-task - Management | 84.47 | Accuracy (%) | 99.5 |
| MMLU-by-task - Marketing | 91.45 | Accuracy (%) | 99.4 |
| MMLU-by-task - High School European History | 85.45 | Accuracy (%) | 99.2 |
| MMLU-by-task - Public Relations | 74.55 | Accuracy (%) | 99.1 |
| MMLU-by-task - Professional Accounting | 57.45 | Accuracy (%) | 99 |
| MMLU-by-task - Professional Law | 56.65 | Accuracy (%) | 98.6 |
| MMLU-by-task - High School Government And Politics | 94.3 | Accuracy (%) | 98.5 |
Interactive version: theaggregate.ai/model?slug=llama-2-70b-chat · How It Works · Data refreshed daily, snapshot 2026-09-05.