CodeLlama-7B-Instruct-hf — benchmark results
Provider: Meta. Released 2023-08-24. Access: Open.
Unified ELO 1219 ± 15, rank #1665 of 1776 rated models, from 77 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| ToolBench - The Cat API | 94 | Task Score | 89.5 |
| ToolBench - VirtualHome | 21.95 | Task Score | 79.1 |
| MMLU-by-task - Econometrics | 32.46 | Accuracy (%) | 77.1 |
| MMLU-by-task - Abstract Algebra | 33 | Accuracy (%) | 75.6 |
| ToolBench - Google Sheets | 41.27 | Task Score | 69.8 |
| ToolBench - Open Weather | 90 | Task Score | 67.4 |
| ToolBench Leaderboard | 50.48 | Average Task Score | 65.1 |
| MMLU-by-task - Machine Learning | 34.82 | Accuracy (%) | 60.6 |
| ToolBench - Home Search | 78 | Task Score | 60.5 |
| ToolBench - Tabletop | 16.98 | Task Score | 60.5 |
| ToolBench - Trip Booking | 61.67 | Task Score | 60.5 |
| MMLU-by-task - Elementary Mathematics | 29.63 | Accuracy (%) | 54.8 |
Interactive version: theaggregate.ai/model?slug=codellama-7b-instruct-hf · How the rankings work · Data refreshed daily, snapshot 2026-07-22.