Gemini 3.1 Pro (Preview) (Thinking): benchmark results

Gemini 3.1 Pro (Preview) evaluated with thinking enabled. Provider: Google. Released 2026-02-19. Access: API.

Unified ELO 1702 ± 1, rank #100 of 1761 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
BALROG TextWorld (LLM)75.7Progress (%)100
LLMEval-Logic Formalization Free45.1Accuracy (%)100
LLMEval-Logic Hard37.5Accuracy (%)100
MathVision89.8Overall Accuracy (%)97.2
BALROG BabyAI (LLM)98Progress (%)97
BALROG BabaIsAI (LLM)83.3Progress (%)93.9
AtmosCoder-Bench96Accuracy (%, mean of 3 runs)93.3
BALROG Crafter (LLM)55Progress (%)92.4
LLMEval-Logic Hard Sub-Q76Accuracy (%)92.3
BALROG NetHack (LLM)2.6Progress (%)90.9
BALROG MiniHack (LLM)27.5Progress (%)86.4
LLMEval-Logic Base74Accuracy (%)84.6

Interactive version: theaggregate.ai/model?slug=gemini-3-1-pro-preview-thinking · How It Works · Data refreshed daily, snapshot 2026-09-05.