GeoCode Leaderboard — leaderboard

Leaderboard for large language models on geospatial code generation using AutoGEEval and AutoGEEval++ pass@k metrics on Google Earth Engine tasks.

Metric: AutoGEEval++ Pass@1 (self-reported). Source: benchmarklist.com. Status: saturation imminent. 28 models tracked.

Top models

#ModelScore
1GPT-4.170.93
2Claude 3.7 Sonnet70.35
3DeepSeek V3 (0324)70.25
4Qwen 2.5 Coder 32B66.77
5GPT-4.1 Mini66.56
6Qwen 2.5 32B65.45
7QwQ-32B60.69
8Qwen 3 32B60.67
9DeepSeek R160.42
10GPT-4o59.02
11O3 Mini (Medium)56.98
12Qwen 3 32B (Thinking)56.31
13GPT-4o Mini55.02
14Qwen 2.5 Coder 7B50.51
15Qwen 2.5 7B49.58

Interactive version: theaggregate.ai/benchmark?slug=geocode-leaderboard · How the rankings work · Data refreshed daily, snapshot 2026-07-22.