4DCodeBench: leaderboard

Metric: Reconstruction score (0–1), five-family mean over 200 scenes; provider-specific coding harnesses. Source: 4dcodebench.com. Saturation forecast: Around April 2027. 18 models tracked.

Top models

#ModelScore
1GPT-6 Astra (Max)0.79
2Claude Opus 5.5 (High)0.78
3GPT-6 Astra (High)0.77
4Claude Fable 5.1 (High)0.74
5GPT-6 Astra (Low)0.73
6Claude Opus 5 (High)0.72
7GPT-5.6 Luna (Max)0.67
8GPT-5.6 Sol (High)0.65
9Gemini 3.8 Flash (High)0.64
10DeepSeek V4.1 Flash (High)0.6
11GPT-5.6 Terra (High)0.55
12GLM-5.3 Flash (Max)0.47
13Muse Glimmer 30B (High)0.44
14MiMo-V2.50.43
15MiniMax-M30.34

Interactive version: theaggregate.ai/benchmark?slug=4dcodebench · How It Works · Data refreshed daily, snapshot 2026-10-08.