Llama 2 13B Chat: benchmark results
Provider: Meta. Released 2023-07-18. Access: Open.
Unified ELO 1357 ± 1, rank #1254 of 1392 rated models, from 45 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Big-Bench Hard | 58.2 | Average (%) | 64.6 |
| European LLM Leaderboard - FLORES200 | 11.71 | Average FLORES200 Score | 58.3 |
| European LLM Leaderboard - FLORES200 Target | 11.71 | FLORES200 Target Score | 58.3 |
| European LLM Leaderboard - FLORES200 Source | 11.71 | FLORES200 Source Score | 57.8 |
| FastEval | 40.94 | Total Score | 43.8 |
| GSM8K | 36.9 | Accuracy (%) | 41.9 |
| BenchBench | 38.68 | Aggregate Score (%) | 38.2 |
| EconLogicQA | 0.15 | Accuracy | 32.4 |
| European LLM Leaderboard - Zero-Shot Accuracy | 40 | Average Accuracy (%) | 26.8 |
| CyberBench (NLP) | 49.2 | Avg Score (%) | 25 |
| European LLM Leaderboard - Accuracy | 40.67 | Average Accuracy (%) | 23.5 |
| MMLU | 50.9 | Accuracy (%) | 20.7 |
Interactive version: theaggregate.ai/model?slug=llama-2-13b-chat · How It Works · Data refreshed daily, snapshot 2026-09-05.