GeoCode Leaderboard: leaderboard

Leaderboard for large language models on geospatial code generation using AutoGEEval and AutoGEEval++ pass@k metrics on Google Earth Engine tasks.

Metric: AutoGEEval++ Pass@1 (self-reported). Source: benchmarklist.com. Status: saturated. 23 models tracked.

Top models

#ModelScore
1GPT-4.170.93
2Claude 3.7 Sonnet70.35
3DeepSeek V3 (0324)70.25
4Qwen 2.5 Coder 32B66.77
5GPT-4.1 Mini66.56
6Qwen 2.5 32B65.45
7QwQ-32B60.69
8Qwen 3 32B60.67
9DeepSeek R160.42
10Qwen 2.5 Coder 7B50.51
11Qwen 2.5 7B49.58
12Qwen 3 8B48.35
13Qwen 2.5 3B36.26
14Qwen 3 4B34.03

Interactive version: theaggregate.ai/benchmark?slug=geocode-leaderboard · How It Works · Data refreshed daily, snapshot 2026-09-05.