CodeGemma-7B: benchmark results

Provider: Google. Access: API.

Unified ELO 1387 ± 19, rank #2229 of 2928 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - GSM8K45.49Accuracy (%) (5-shot)59.5
ShaderMatch11.17Clone Match Rate (%)47.6
EffiBench - NET3.02Normalized Execution Time42.7
BigCode Models Leaderboard40.1HumanEval Python Pass@1 (%)42.4
EvalPlus (HumanEval+ & MBPP+)47Pass@1 avg (%)40.3
Open LLM Leaderboard v1 - MMLU56.59Accuracy (%) (5-shot)39.6
Big Code Memorization - HumanEval pass@143.29HumanEval pass@1 (%)35.3
Big Code Memorization - HumanEval pass@5033.16HumanEval pass@50 (%)35.3
Big Code Memorization - HumanEval-ET pass@135.37HumanEval-ET pass@1 (%)35.3
Big Code Memorization - HumanEval-ET pass@5027.79HumanEval-ET pass@50 (%)35.3
Open LLM Leaderboard v1 - ARC Challenge53.92Normalized accuracy (%) (25-shot)30.5
Open LLM Leaderboard v1 - HellaSwag76.73Normalized accuracy (%) (10-shot)29.4

Interactive version: theaggregate.ai/model?slug=codegemma-7b · How It Works · Data refreshed daily, snapshot 2026-09-23.