CodeLlama-7B-Python-hf — benchmark results

Provider: Meta. Released 2023-08-24. Access: Open.

Unified ELO 1203 ± 15, rank #1689 of 1776 rated models, from 72 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
MMLU-by-task - College Physics35.29Accuracy (%)88.7
MMLU-by-task - High School Physics35.1Accuracy (%)81.9
ToolBench - Google Sheets49.13Task Score79.1
MMLU-by-task - High School Statistics46.3Accuracy (%)79
ToolBench - Home Search83Task Score74.4
ToolBench - The Cat API88Task Score74.4
ToolBench - Trip Booking68.33Task Score72.1
ToolBench Leaderboard52.15Average Task Score72.1
MMLU-by-task - College Chemistry39Accuracy (%)70.2
ToolBench - Tabletop22.86Task Score69.8
ToolBench - VirtualHome21.33Task Score67.4
ToolBench - WebShop Short1.58Task Score58.1

Interactive version: theaggregate.ai/model?slug=codellama-7b-python-hf · How the rankings work · Data refreshed daily, snapshot 2026-07-22.