Gert Labs Rankings: leaderboard

Gert Labs global model ranking across game environments that evaluate agentic coding, one-shot coding, and decision-making performance.

Metric: GScore (%). Source: gertlabs.com. Status: years away from saturation. 100 models tracked.

Top models

#ModelScore
1Claude Fable 5.174.45
2Claude Opus 573.66
3Claude Fable 572.25
4GPT-5.6 Sol70.95
5Grok 4.669.35
6Gemini 3.7 Flash65.32
7GPT-5.563.82
8GLM-5.361.92
9Kimi K360.91
10GPT-5.6 Terra60.91
11Gemini 3.6 Flash60.41
12Muse Spark 1.160.18
13DeepSeek V4 Pro (0813)59
14Claude Opus 4.858.29
15Qwen 3.8 Max57.01

Interactive version: theaggregate.ai/benchmark?slug=gert-labs-rankings · How It Works · Data refreshed daily, snapshot 2026-09-05.