GeoRC: leaderboard

Geolocation reasoning benchmark for vision-language models, measuring location inference, F1, and country-level accuracy.

Metric: F1 (self-reported). Source: benchmarklist.com. Status: saturation imminent. 12 models tracked.

Top models

#ModelScore
1GPT-4.142.3
2Gemini 2.5 Pro41.51
3Gemini 2.5 Flash41.3
4Gemini 3 Pro40.98
5GPT-540.56
6Qwen 2.5 VL 7B Instruct31.63
7Gemma 3 12B (IT)31.21
8Llama 3.2 11B Instruct25.86
9Qwen 3 VL 8B Instruct23.81

Interactive version: theaggregate.ai/benchmark?slug=georc · How It Works · Data refreshed daily, snapshot 2026-09-05.