Gemini 2.5 Pro (Thinking): benchmark results
Provider: Google. Released 2025-06-05. Access: API.
Unified ELO 1649 ± 1, rank #350 of 3081 rated models, from 9 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| MMMU Benchmark | 84 | Validation Score | 97.9 |
| DocHop | 40.6 | Accuracy (%) | 94.7 |
| OenoBench (Expert) | 69.4 | Accuracy (%, L4 expert tier) | 93.3 |
| SEAL - AudioMultiChallenge - Text Output | 46.9 | Score | 82.4 |
| MMSI-Bench | 37 | Accuracy (%) | 81.6 |
| AudioMC | 46.9 | Score (self-reported) | 81.5 |
| DentalGPT Dental Eval Suite | 57.9 | Average Accuracy (self-reported) | 75 |
| ALE-Bench | 785.52 | Performance (Self-Refine x1) (self-reported) | 52.3 |
| VitaBench 2.0 | 33.1 | Avg@4 Full Context (self-reported) | 30.7 |
Interactive version: theaggregate.ai/model?slug=gemini-2-5-pro-thinking · How It Works · Data refreshed daily, snapshot 2026-09-21.