Gemma 4 31B (Reasoning): benchmark results

Gemma 4 31B evaluated with reasoning enabled. Provider: Google. Released 2026-04-02. Access: Open.

Unified ELO 1603 ± 1, rank #426 of 1761 rated models, from 46 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA IFBench75.58Accuracy (%)93.4
AA Terminal-Bench Hard36.36Accuracy (%)83.3
AA GPQA Diamond85.66Accuracy (%)79.4
AA Humanity's Last Exam23.63Accuracy (%)75.7
PACT (Lechmazur)1557PACT Bilateral Rating74
AA Omniscience - Software Engineering (SWE) - PHP30Accuracy (%)72.5
AA Omniscience - Software Engineering (SWE) - Dart24Accuracy (%)72.2
AA Omniscience - Software Engineering (SWE) - JavaScript33.64Accuracy (%)69.1
Artificial Analysis Intelligence Index22.23Intelligence Index68.5
AA Omniscience - Software Engineering (SWE) - Go22Accuracy (%)68.4
AA CritPt1.43Accuracy (%)68.1
AA Omniscience - Software Engineering (SWE) - C41Accuracy (%)66.4

Interactive version: theaggregate.ai/model?slug=gemma-4-31b-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-05.