CodeGemma-7B-it: benchmark results

Provider: Google. Access: API.

Unified ELO 1404 ± 20, rank #2103 of 2928 rated models, from 10 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
BigCode Models Leaderboard52.7HumanEval Python Pass@1 (%)67.8
Open LLM Leaderboard v1 - GSM8K52.46Accuracy (%) (5-shot)64.4
EvalPlus (HumanEval+ & MBPP+)54.3Pass@1 avg (%)51.6
Open LLM Leaderboard v1 - TruthfulQA MC248.52MC2 (%) (0-shot)41.5
Open LLM Leaderboard v1 - MMLU56.1Accuracy (%) (5-shot)38.2
Open LLM Leaderboard v1 - ARC Challenge53.84Normalized accuracy (%) (25-shot)30.4
McEval30.7AVG (%)28.6
Open LLM Leaderboard v1 - HellaSwag72.51Normalized accuracy (%) (10-shot)22.9
Open LLM Leaderboard v1 - WinoGrande66.22Accuracy (%) (5-shot)19.9
RepoQA2.2Score (self-reported)0

Interactive version: theaggregate.ai/model?slug=codegemma-7b-it · How It Works · Data refreshed daily, snapshot 2026-09-23.