CodeLlama-7B-Instruct-hf — benchmark results

Provider: Meta. Released 2023-08-24. Access: Open.

Unified ELO 1219 ± 15, rank #1665 of 1776 rated models, from 77 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
ToolBench - The Cat API94Task Score89.5
ToolBench - VirtualHome21.95Task Score79.1
MMLU-by-task - Econometrics32.46Accuracy (%)77.1
MMLU-by-task - Abstract Algebra33Accuracy (%)75.6
ToolBench - Google Sheets41.27Task Score69.8
ToolBench - Open Weather90Task Score67.4
ToolBench Leaderboard50.48Average Task Score65.1
MMLU-by-task - Machine Learning34.82Accuracy (%)60.6
ToolBench - Home Search78Task Score60.5
ToolBench - Tabletop16.98Task Score60.5
ToolBench - Trip Booking61.67Task Score60.5
MMLU-by-task - Elementary Mathematics29.63Accuracy (%)54.8

Interactive version: theaggregate.ai/model?slug=codellama-7b-instruct-hf · How the rankings work · Data refreshed daily, snapshot 2026-07-22.