CodeLlama-13B-Instruct-hf — benchmark results
Provider: Meta. Released 2023-08-24. Access: Open.
Unified ELO 1265 ± 18, rank #1590 of 1776 rated models, from 77 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| ToolBench - Tabletop | 57.62 | Task Score | 95.3 |
| ToolBench - Open Weather | 98 | Task Score | 93 |
| ToolBench Leaderboard | 60.49 | Average Task Score | 88.4 |
| ToolBench - VirtualHome | 22.56 | Task Score | 86 |
| ToolBench - WebShop Short | 9.7 | Task Score | 83.7 |
| ToolBench - Home Search | 85 | Task Score | 81.4 |
| MMLU-by-task - College Physics | 32.35 | Accuracy (%) | 80.4 |
| ToolBench - The Cat API | 89.58 | Task Score | 79.1 |
| ToolBench - Trip Booking | 72.5 | Task Score | 79.1 |
| ToolBench - Google Sheets | 48.97 | Task Score | 76.7 |
| EffiBench - NET | 2.93 | Normalized Execution Time | 63.4 |
| MMLU-by-task - Abstract Algebra | 31 | Accuracy (%) | 60.2 |
Interactive version: theaggregate.ai/model?slug=codellama-13b-instruct-hf · How the rankings work · Data refreshed daily, snapshot 2026-07-22.