CodeLlama-13B-Instruct-hf — benchmark results

Provider: Meta. Released 2023-08-24. Access: Open.

Unified ELO 1265 ± 18, rank #1590 of 1776 rated models, from 77 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
ToolBench - Tabletop57.62Task Score95.3
ToolBench - Open Weather98Task Score93
ToolBench Leaderboard60.49Average Task Score88.4
ToolBench - VirtualHome22.56Task Score86
ToolBench - WebShop Short9.7Task Score83.7
ToolBench - Home Search85Task Score81.4
MMLU-by-task - College Physics32.35Accuracy (%)80.4
ToolBench - The Cat API89.58Task Score79.1
ToolBench - Trip Booking72.5Task Score79.1
ToolBench - Google Sheets48.97Task Score76.7
EffiBench - NET2.93Normalized Execution Time63.4
MMLU-by-task - Abstract Algebra31Accuracy (%)60.2

Interactive version: theaggregate.ai/model?slug=codellama-13b-instruct-hf · How the rankings work · Data refreshed daily, snapshot 2026-07-22.