CodeLlama-70B-Instruct-hf: benchmark results

Provider: Meta. Access: Open.

Unified ELO 1424 ± 20, rank #1947 of 2928 rated models, from 10 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - GSM8K46.25Accuracy (%) (5-shot)60.1
Open LLM Leaderboard v1 - TruthfulQA MC250.44MC2 (%) (0-shot)48.4
Open LLM Leaderboard v1 - MMLU56.4Accuracy (%) (5-shot)39.1
Open LLM Leaderboard v1 - WinoGrande74.51Accuracy (%) (5-shot)37.1
DuckDB-NSQL48Execution Accuracy (%)35.9
EffiBench - NET3.07Normalized Execution Time35.4
Open LLM Leaderboard v1 - ARC Challenge55.03Normalized accuracy (%) (25-shot)32.6
Open LLM Leaderboard v1 - HellaSwag77.24Normalized accuracy (%) (10-shot)30.4
EffiBench - NMU1.93Normalized Memory Usage25.6
BiGGen-Bench2.81Average Score (1-5)23.5

Interactive version: theaggregate.ai/model?slug=codellama-70b-instruct-hf · How It Works · Data refreshed daily, snapshot 2026-09-23.