gemma-7B (IT) — benchmark results
Provider: Google. Released 2024-02-21. Access: Open.
Unified ELO 1273 ± 17, rank #1584 of 1776 rated models, from 207 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open Japanese LLM - Wikicorpus J TO E Bleu EN | 18.97 | Score (%) | 96.6 |
| Open Japanese LLM - Wikicorpus E TO J Bleu JA | 36.99 | Score (%) | 95.4 |
| Open Japanese LLM - ALT E TO J Bleu JA | 18.17 | Score (%) | 94.2 |
| LLM Trustworthy - Stereotype | 100 | Trust Score (%) | 94 |
| Fin-Bias | 97.6 | Average Herding Score (with rating) (self-reported) | 83.3 |
| Open CoT - LogiQA | 6.55 | CoT Gain (%) | 82.1 |
| Open LLM Leaderboard - MuSR | 12.53 | Score | 68.6 |
| LLM Trustworthy - Privacy | 83.69 | Trust Score (%) | 68 |
| LLM Trustworthy - Toxicity | 75.52 | Trust Score (%) | 68 |
| OpenEval - BBQ | 63.46 | Exact Match (%) | 63.8 |
| OpenEval - GPQA CoT | 27.58 | CoT Correctness (%) | 61.9 |
| SALAD-Bench | 54.81 | Average Safety Score (%) | 60.6 |
Interactive version: theaggregate.ai/model?slug=gemma-7b-it · How the rankings work · Data refreshed daily, snapshot 2026-07-22.