Gemini 2.0 Flash (Thinking): benchmark results

Gemini 2.0 Flash evaluated with thinking enabled. Provider: Google. Released 2024-12-11. Access: API.

Unified ELO 1573 ± 1, rank #544 of 1761 rated models, from 54 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Video-Holmes43.1Overall (self-reported)93.3
SEAL - Arabic1120Score86.1
SEAL - Spanish1108Score81
EmoBench-M60.6Average Score80
VRBench60.97Overall (self-reported)78.6
SEAL - Coding1108Score77.8
LongBench v256Accuracy (%)76.5
SEAL - Agentic Tool Use (Chat)57.36Score75.8
WebApp1K85.9Pass@1 (%)72.7
Divergent Thinking4.41Divergence Score69.4
MMToM-QA54All (%)69.2
Episodic Memory70.8Simple Recall (%)67.5

Interactive version: theaggregate.ai/model?slug=gemini-2-0-flash-thinking · How It Works · Data refreshed daily, snapshot 2026-09-05.