Llama 2 7B Base — benchmark results
Provider: Meta. Released 2023-07-18. Access: Open.
Unified ELO 1264 ± 13, rank #1592 of 1776 rated models, from 220 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| EuroEval Swedish NLU - Swerec | 79.05 | Sentiment classification Score (%) | 90.3 |
| MMLU-by-task - High School Mathematics | 30.37 | Accuracy (%) | 79.4 |
| MMLU-by-task - Machine Learning | 38.39 | Accuracy (%) | 75.4 |
| MMLU-by-task - College Mathematics | 35 | Accuracy (%) | 75.2 |
| URIAL-Bench - Roleplay | 7.48 | Judge Score (0-10) | 72.2 |
| MMLU-by-task - Professional Medicine | 52.57 | Accuracy (%) | 71.3 |
| MMLU-by-task - Anatomy | 48.15 | Accuracy (%) | 66.4 |
| MMLU-by-task - Business Ethics | 53 | Accuracy (%) | 66 |
| MMLU-by-task - Electrical Engineering | 47.59 | Accuracy (%) | 65.1 |
| MMLU-by-task - Philosophy | 60.13 | Accuracy (%) | 64.9 |
| Open CoT - LSAT Analytical Reasoning | 4.78 | CoT Gain (%) | 63 |
| MMLU-by-task - Conceptual Physics | 42.13 | Accuracy (%) | 62.7 |
Interactive version: theaggregate.ai/model?slug=llama-2-7b-base · How the rankings work · Data refreshed daily, snapshot 2026-07-22.