Gemini 2.0 Flash (Thinking) — benchmark results

Gemini 2.0 Flash evaluated with thinking enabled. Provider: Google. Released 2024-12-11. Access: API.

Unified ELO 1615 ± 18, rank #445 of 1776 rated models, from 61 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
MMVU69.5Score (self-reported)97.1
Video-Holmes43.1Overall (self-reported)93.3
SEAL - Arabic1120Score86.1
SEAL - Spanish1108Score81
EmoBench-M60.6Average Score80
VRBench60.97Overall (self-reported)78.6
AA MATH-50094.4Accuracy (%)78.5
SEAL - Coding1108Score77.8
LongBench v256Accuracy (%)76.5
SEAL - Agentic Tool Use (Chat)57.36Score75.8
WebApp1K85.9Pass@1 (%)72.7
Divergent Thinking4.41Divergence Score69.4

Interactive version: theaggregate.ai/model?slug=gemini-2-0-flash-thinking · How the rankings work · Data refreshed daily, snapshot 2026-07-22.