Gemma 4 31B (IT) — benchmark results
Instruction-tuned Gemma 4 31B checkpoint. Provider: Google. Released 2026-04-02. Access: Open.
Unified ELO 1689 ± 10, rank #294 of 1776 rated models, from 437 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AGC-Bench - chinese_homophonic_puns | 1.56 | Dataset z-score | 100 |
| AGC-Bench - outline_to_story | 1.81 | Dataset z-score | 100 |
| BRIDGE Medical Leaderboard | 49.17 | Average Performance (%) | 100 |
| BRIDGE Medical Leaderboard - CoT | 45.88 | Average Performance (%) | 100 |
| BRIDGE Medical Leaderboard - Zero-Shot | 46.74 | Average Performance (%) | 100 |
| EuroEval Danish Summarization - Nordjylland News | 38.54 | Score (%) | 100 |
| EuroEval French NLU | 79.51 | NLU Average Score (%) | 100 |
| EuroEval Lithuanian NLU - Atsiliepimai | 50.67 | Sentiment classification Score (%) | 100 |
| EuroEval Polish NLU | 68.96 | NLU Average Score (%) | 100 |
| EuroEval Portuguese NLU | 73.53 | NLU Average Score (%) | 100 |
| EuroEval Slovak NLU | 63.33 | NLU Average Score (%) | 100 |
| EuroEval Slovene NLU - Sentinews | 58.61 | Sentiment classification Score (%) | 100 |
Interactive version: theaggregate.ai/model?slug=gemma-4-31b-it · How the rankings work · Data refreshed daily, snapshot 2026-07-22.