Gemma 4 31B (Non-reasoning): benchmark results
Provider: Google. Released 2026-04-02. Access: Open.
Unified ELO 1599 ± 1, rank #629 of 3078 rated models, from 56 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| TRACE Bench - Character Consistency | 95.46 | Checklist completion rate (%) | 100 |
| TRACE Bench - Overall | 96.02 | Weighted overall score (%) | 100 |
| TRACE Bench - Diversity | 93.49 | Normalized repetition-penalty score (%) | 96 |
| TRACE Bench - Length | 98.49 | Reply-length compliance (%) | 96 |
| TRACE Bench - Short-Term Memory | 90.5 | Memory-probe completion rate (%) | 88 |
| TRACE Bench - Language Quality | 97.66 | Per-turn LLM-judge language quality (%) | 76 |
| AA Terminal-Bench Hard | 30.3 | Accuracy (%) | 72.3 |
| AA Omniscience - Software Engineering (SWE) - Swift | 40 | Accuracy (%) | 70.1 |
| AA Omniscience - Software Engineering (SWE) - Rust | 54 | Accuracy (%) | 68.9 |
| AA Omniscience - Software Engineering (SWE) - Go | 22 | Accuracy (%) | 68.4 |
| AA Omniscience - Software Engineering (SWE) - Dart | 22 | Accuracy (%) | 66.2 |
| AA Omniscience - Software Engineering (SWE) - PHP | 26 | Accuracy (%) | 65 |
Interactive version: theaggregate.ai/model?slug=gemma-4-31b-non-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-19.