CodeGemma-7B-it: benchmark results
Provider: Google. Access: API.
Unified ELO 1404 ± 20, rank #2103 of 2928 rated models, from 10 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| BigCode Models Leaderboard | 52.7 | HumanEval Python Pass@1 (%) | 67.8 |
| Open LLM Leaderboard v1 - GSM8K | 52.46 | Accuracy (%) (5-shot) | 64.4 |
| EvalPlus (HumanEval+ & MBPP+) | 54.3 | Pass@1 avg (%) | 51.6 |
| Open LLM Leaderboard v1 - TruthfulQA MC2 | 48.52 | MC2 (%) (0-shot) | 41.5 |
| Open LLM Leaderboard v1 - MMLU | 56.1 | Accuracy (%) (5-shot) | 38.2 |
| Open LLM Leaderboard v1 - ARC Challenge | 53.84 | Normalized accuracy (%) (25-shot) | 30.4 |
| McEval | 30.7 | AVG (%) | 28.6 |
| Open LLM Leaderboard v1 - HellaSwag | 72.51 | Normalized accuracy (%) (10-shot) | 22.9 |
| Open LLM Leaderboard v1 - WinoGrande | 66.22 | Accuracy (%) (5-shot) | 19.9 |
| RepoQA | 2.2 | Score (self-reported) | 0 |
Interactive version: theaggregate.ai/model?slug=codegemma-7b-it · How It Works · Data refreshed daily, snapshot 2026-09-23.