Llama 2 70B Chat GPTQ — benchmark results
Provider: Meta. Released 2023-07-18. Access: Open.
Unified ELO 1323 ± 11, rank #1485 of 1776 rated models, from 69 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| MMLU-by-task - College Computer Science | 60 | Accuracy (%) | 99 |
| MMLU-by-task - Jurisprudence | 83.33 | Accuracy (%) | 98.1 |
| MMLU-by-task - US Foreign Policy | 88 | Accuracy (%) | 94.4 |
| MMLU-by-task - Management | 81.55 | Accuracy (%) | 94.1 |
| JustEval - Safety | 5 | Score (1-5) | 93.3 |
| MMLU-by-task - High School US History | 86.27 | Accuracy (%) | 93.1 |
| MMLU-by-task - Electrical Engineering | 57.93 | Accuracy (%) | 93 |
| MMLU-by-task - Security Studies | 75.92 | Accuracy (%) | 92.7 |
| MMLU-by-task - Astronomy | 73.03 | Accuracy (%) | 92.3 |
| MMLU-by-task - College Medicine | 60.12 | Accuracy (%) | 92.3 |
| MMLU-by-task - Sociology | 84.58 | Accuracy (%) | 92.3 |
| MMLU-by-task - College Chemistry | 47 | Accuracy (%) | 92.1 |
Interactive version: theaggregate.ai/model?slug=llama-2-70b-chat-gptq · How the rankings work · Data refreshed daily, snapshot 2026-07-22.