Gemma 4 31B (Non-reasoning): benchmark results

Provider: Google. Released 2026-04-02. Access: Open.

Unified ELO 1599 ± 1, rank #629 of 3078 rated models, from 56 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
TRACE Bench - Character Consistency95.46Checklist completion rate (%)100
TRACE Bench - Overall96.02Weighted overall score (%)100
TRACE Bench - Diversity93.49Normalized repetition-penalty score (%)96
TRACE Bench - Length98.49Reply-length compliance (%)96
TRACE Bench - Short-Term Memory90.5Memory-probe completion rate (%)88
TRACE Bench - Language Quality97.66Per-turn LLM-judge language quality (%)76
AA Terminal-Bench Hard30.3Accuracy (%)72.3
AA Omniscience - Software Engineering (SWE) - Swift40Accuracy (%)70.1
AA Omniscience - Software Engineering (SWE) - Rust54Accuracy (%)68.9
AA Omniscience - Software Engineering (SWE) - Go22Accuracy (%)68.4
AA Omniscience - Software Engineering (SWE) - Dart22Accuracy (%)66.2
AA Omniscience - Software Engineering (SWE) - PHP26Accuracy (%)65

Interactive version: theaggregate.ai/model?slug=gemma-4-31b-non-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-19.