E-Commerce Bench: leaderboard

Metric: Final Assets (¥k, mean of 5 episodes). Source: github.com. 18 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol (Max)1431
2GPT-5.5702
3Claude Opus 4.8 (Max)498
4GLM-5.2 (High)301
5Kimi K3265
6Claude Opus 4.7 (Max)259
7Claude Opus 4.6 (Max)258
8GLM-5.1226
9Gemini 3.5 Flash190
10Qwen 3.7 Max165
11Gemini 3.1 Pro (Preview)130
12GLM-5.2 (Max)115
13Kimi K2.670
14Qwen 3.6 Plus47
15Qwen 3.5 Plus1.1

Interactive version: theaggregate.ai/benchmark?slug=e-commerce-bench · How It Works · Data refreshed daily, snapshot 2026-09-05.