Llama 2 7B — benchmark results
Provider: Meta. Released 2023-07-18. Access: Open.
Unified ELO 1285 ± 12, rank #1565 of 1776 rated models, from 92 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| OpenEval - CNN/DailyMail | 25.28 | ROUGE-L | 94.1 |
| LIBRA - LongContextMultiQ | 7.92 | Dataset Total Score (%) | 89.3 |
| OpenEval - BoolQ | 84.38 | Exact Match (%) | 83.3 |
| HELM Classic - Synthetic Reasoning Natural | 26.02 | F1 (%) | 82.4 |
| HELM Classic - bAbI | 54.97 | Exact Match (%) | 81.9 |
| HELM Classic - QuAC | 40.62 | F1 (%) | 80 |
| ToolBench - WebShop Short | 6.92 | Task Score | 79.1 |
| LIBRA - ruBABILongQA3 | 16.31 | Dataset Total Score (%) | 78.6 |
| HELM Classic - WikiFact | 33.49 | Exact Match (%) | 75.8 |
| HELM Classic - Dyck | 65.8 | Exact Match (%) | 75 |
| HELM Classic - Entity Matching | 85.07 | Exact Match (%) | 74.2 |
| OpenEval - XSum | 26.07 | ROUGE-L | 72.2 |
Interactive version: theaggregate.ai/model?slug=llama-2-7b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.