Llama 2 13B Chat — benchmark results
Provider: Meta. Released 2023-07-18. Access: Open.
Unified ELO 1173 ± 50, rank #1715 of 1776 rated models, from 30 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Big-Bench Hard | 58.2 | Average (%) | 64.6 |
| European LLM Leaderboard - FLORES200 | 11.71 | Average FLORES200 Score | 58.3 |
| European LLM Leaderboard - FLORES200 Target | 11.71 | FLORES200 Target Score | 58.3 |
| European LLM Leaderboard - FLORES200 Source | 11.71 | FLORES200 Source Score | 57.8 |
| FastEval | 40.94 | Total Score | 43.8 |
| GSM8K | 36.9 | Accuracy (%) | 41.5 |
| BenchBench | 38.68 | Aggregate Score (%) | 38.2 |
| InfiBench | 32.29 | Score (%) | 37.1 |
| EconLogicQA | 0.15 | Accuracy | 32.4 |
| European LLM Leaderboard - Zero-Shot Accuracy | 40 | Average Accuracy (%) | 26.8 |
| CyberBench (NLP) | 49.2 | Avg Score (%) | 25 |
| European LLM Leaderboard - Accuracy | 40.67 | Average Accuracy (%) | 23.5 |
Interactive version: theaggregate.ai/model?slug=llama-2-13b-chat · How the rankings work · Data refreshed daily, snapshot 2026-07-22.