Gemini 3.1 Flash — benchmark results
Google Gemini 3.1 Flash model row. Provider: Google. Released 2026-03-03. Access: API.
Unified ELO 1871 ± 77, rank #88 of 1776 rated models, from 13 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| BehaviorBench | 31.3 | Game Behav. Sim. (W â) (self-reported) | 94.7 |
| Chatbot Arena (Text-to-Image) | 1261 | Elo | 94.5 |
| HarmVideoBench | 81.3 | Macro Avg. (self-reported) | 90 |
| Can Large Language Models Handle Discourse Par | 70.1 | Overall Avg (MS) (self-reported) | 88.9 |
| Chatbot Arena (Image Edit) | 1385 | Elo | 85.3 |
| HOLMES | 54.31 | Overall Accuracy (self-reported) | 70 |
| Open Financial LLM - BloombergGPT | 80.88 | Average Score | 60 |
| Vision2Code | 3.17 | Avg. (self-reported) | 55.6 |
| Beyond Function Calling | 41.6 | Overall (self-reported) | 54.5 |
| TaxBench | 15.93 | Mean pass^5 (computed) (self-reported) | 53.3 |
| CC-OCR V2 | 61.36 | Average (self-reported) | 50 |
| CheXpercept | 87.1 | Stage 1 (End-to-End) (self-reported) | 46.2 |
Interactive version: theaggregate.ai/model?slug=gemini-3-1-flash · How the rankings work · Data refreshed daily, snapshot 2026-07-22.