CodeGemma-2B: benchmark results

Provider: Google. Access: API.

Unified ELO 1238 ± 18, rank #2826 of 2928 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
EvalPlus (HumanEval+ & MBPP+)33.6Pass@1 avg (%)23.4
Open LLM Leaderboard v1 - GSM8K4.62Accuracy (%) (5-shot)23.1
ShaderMatch6.85Clone Match Rate (%)19
Open LLM Leaderboard v1 - TruthfulQA MC241.22MC2 (%) (0-shot)16.4
Open LLM Leaderboard v1 - MMLU28.32Accuracy (%) (5-shot)15.7
Big Code Memorization - HumanEval pass@135.37HumanEval pass@1 (%)14.7
BigCode Models Leaderboard27.3HumanEval Python Pass@1 (%)13.6
Open LLM Leaderboard v1 - HellaSwag39.63Normalized accuracy (%) (10-shot)8
Open LLM Leaderboard v1 - WinoGrande53.67Accuracy (%) (5-shot)8
Big Code Memorization - HumanEval-ET pass@128.05HumanEval-ET pass@1 (%)5.9
Open LLM Leaderboard v1 - ARC Challenge25.68Normalized accuracy (%) (25-shot)5
Wolfram LLM Benchmarking Project7.7Correct Functionality (%)3.5

Interactive version: theaggregate.ai/model?slug=codegemma-2b · How It Works · Data refreshed daily, snapshot 2026-09-23.