CodeLlama-13B-Python-hf — benchmark results

Provider: Meta. Released 2023-08-24. Access: Open.

Unified ELO 1191 ± 19, rank #1700 of 1776 rated models, from 72 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
ToolBench - Tabletop41.53Task Score86
ToolBench - The Cat API92.35Task Score86
ToolBench - Home Search86Task Score83.7
ToolBench - Google Sheets50.79Task Score81.4
ToolBench - Open Weather93Task Score80.2
ToolBench Leaderboard56.31Average Task Score79.1
ToolBench - VirtualHome21.94Task Score76.7
ToolBench - Trip Booking62.5Task Score62.8
ToolBench - WebShop Short2.4Task Score62.8
MMLU-by-task - Moral Scenarios27.15Accuracy (%)58.5
MMLU-by-task - High School Statistics39.81Accuracy (%)54.6
MMLU-by-task - High School Physics29.8Accuracy (%)46.5

Interactive version: theaggregate.ai/model?slug=codellama-13b-python-hf · How the rankings work · Data refreshed daily, snapshot 2026-07-22.