Gemini 3.1 Flash — benchmark results

Google Gemini 3.1 Flash model row. Provider: Google. Released 2026-03-03. Access: API.

Unified ELO 1871 ± 77, rank #88 of 1776 rated models, from 13 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
BehaviorBench31.3Game Behav. Sim. (W ↓) (self-reported)94.7
Chatbot Arena (Text-to-Image)1261Elo94.5
HarmVideoBench81.3Macro Avg. (self-reported)90
Can Large Language Models Handle Discourse Par70.1Overall Avg (MS) (self-reported)88.9
Chatbot Arena (Image Edit)1385Elo85.3
HOLMES54.31Overall Accuracy (self-reported)70
Open Financial LLM - BloombergGPT80.88Average Score60
Vision2Code3.17Avg. (self-reported)55.6
Beyond Function Calling41.6Overall (self-reported)54.5
TaxBench15.93Mean pass^5 (computed) (self-reported)53.3
CC-OCR V261.36Average (self-reported)50
CheXpercept87.1Stage 1 (End-to-End) (self-reported)46.2

Interactive version: theaggregate.ai/model?slug=gemini-3-1-flash · How the rankings work · Data refreshed daily, snapshot 2026-07-22.