CodeLlama-13B-hf — benchmark results
Provider: Meta. Released 2023-08-24. Access: Open.
Unified ELO 1217 ± 17, rank #1669 of 1776 rated models, from 77 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| EffiBench - NET | 2.71 | Normalized Execution Time | 95.1 |
| EffiBench - NMU | 1.85 | Normalized Memory Usage | 95.1 |
| MMLU-by-task - High School Statistics | 48.15 | Accuracy (%) | 87.2 |
| ToolBench - Home Search | 87 | Task Score | 87.2 |
| ToolBench - Open Weather | 96 | Task Score | 86 |
| ToolBench - Google Sheets | 51.26 | Task Score | 83.7 |
| ToolBench - Tabletop | 40.95 | Task Score | 83.7 |
| ToolBench - VirtualHome | 22.28 | Task Score | 83.7 |
| ToolBench Leaderboard | 56.89 | Average Task Score | 83.7 |
| MMLU-by-task - College Physics | 31.37 | Accuracy (%) | 77.5 |
| ToolBench - Trip Booking | 70.83 | Task Score | 74.4 |
| MMLU-by-task - College Chemistry | 40 | Accuracy (%) | 73.7 |
Interactive version: theaggregate.ai/model?slug=codellama-13b-hf · How the rankings work · Data refreshed daily, snapshot 2026-07-22.