Gemini 3.1 Pro (Preview) (Thinking) — benchmark results

Gemini 3.1 Pro (Preview) evaluated with thinking enabled. Provider: Google. Released 2026-02-19. Access: API.

Unified ELO 1907 ± 30, rank #61 of 1776 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
BALROG TextWorld (LLM)75.7Progress (%)100
LLMEval-Logic Formalization Free45.1Accuracy (%)100
LLMEval-Logic Hard37.5Accuracy (%)100
MathVision89.8Overall Accuracy (%)97.2
BALROG BabyAI (LLM)98Progress (%)97
BALROG BabaIsAI (LLM)83.3Progress (%)93.9
BALROG Crafter (LLM)55Progress (%)92.4
LLMEval-Logic Hard Sub-Q76Accuracy (%)92.3
BALROG NetHack (LLM)2.6Progress (%)90.9
BALROG MiniHack (LLM)27.5Progress (%)86.4
LLMEval-Logic Base74Accuracy (%)84.6
SEAL - SWE-Bench Pro (Public Dataset)46.1Score83.3

Interactive version: theaggregate.ai/model?slug=gemini-3-1-pro-preview-thinking · How the rankings work · Data refreshed daily, snapshot 2026-07-22.