CodeLlama-13B-hf — benchmark results

Provider: Meta. Released 2023-08-24. Access: Open.

Unified ELO 1217 ± 17, rank #1669 of 1776 rated models, from 77 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
EffiBench - NET2.71Normalized Execution Time95.1
EffiBench - NMU1.85Normalized Memory Usage95.1
MMLU-by-task - High School Statistics48.15Accuracy (%)87.2
ToolBench - Home Search87Task Score87.2
ToolBench - Open Weather96Task Score86
ToolBench - Google Sheets51.26Task Score83.7
ToolBench - Tabletop40.95Task Score83.7
ToolBench - VirtualHome22.28Task Score83.7
ToolBench Leaderboard56.89Average Task Score83.7
MMLU-by-task - College Physics31.37Accuracy (%)77.5
ToolBench - Trip Booking70.83Task Score74.4
MMLU-by-task - College Chemistry40Accuracy (%)73.7

Interactive version: theaggregate.ai/model?slug=codellama-13b-hf · How the rankings work · Data refreshed daily, snapshot 2026-07-22.