Gemma 4 31B: benchmark results
Google's flagship dense Gemma 4 31B open model. Provider: Google. Released 2026-04-02. Access: Open.
Unified ELO 1607 ± 1, rank #243 of 1392 rated models, from 441 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Codeforces ELO | 2150 | ELO (self-reported) | 100 |
| SEA-HELM | 75.19 | Mean Score (%) | 100 |
| TeleResilienceBench | 29.1 | Macro Average CFR (self-reported) | 100 |
| Kaggle FACTS Grounding | 80.67 | Score (%) | 97.8 |
| RAI-Bench - Refusal Rate (JD) | 100 | Rate (%) | 97.4 |
| ReasonScape R12 | 927.77 | ReasonScore | 95.6 |
| P3B3 | 98 | LLM pt-PT (↑) (self-reported) | 94.7 |
| RAI-Bench - Refusal Rate (Career) | 100 | Rate (%) | 93.5 |
| Fibble4 Arena | 8.33 | Win Rate (%) | 92.9 |
| MathVision | 85.6 | Overall Accuracy (%) | 92.5 |
| ALEM (Multi-Agent Coordination) | 10.1 | Total Achievement % (medium) | 91.7 |
| Wordle Arena | 91.67 | Win Rate (%) | 91.7 |
Interactive version: theaggregate.ai/model?slug=gemma-4-31b · How It Works · Data refreshed daily, snapshot 2026-09-05.