LiveClawBench - Medium: leaderboard

Metric: Average reward (0-100) over three runs on the 46 Medium cases (DeepSeek-V4-Pro anchor reward 0.3 to 0.7), OpenClaw-style personal-assistant tasks run in reproducible full-stack mock services (22 stateful web applications, browser, APIs and shell), three runs per case, rewards from case verifiers and a DeepSeek-V3.2 rubric judge for open-ended cases; higher is better. Source: arxiv.org. Saturation forecast: Around January 2027. 17 models tracked.

Top models

#ModelScore
1GPT-5.567.7
2Kimi K2.7 Code67.3
3GLM-5.265
4GLM-5.163.2
5MiMo-V2.5-Pro62.6
6MiniMax-M359
7Qwen 3.6 Plus57.3
8Qwen 3.6 Flash57.2
9Claude Opus 4.856.6
10Kimi K2.655
11MiniMax-M2.748.9
12DeepSeek V4 Flash48.1
13Qwen 3.5 Plus37.6
14Qwen 3.5 Flash34.6
15Qwen 3.6 27B33.4

Interactive version: theaggregate.ai/benchmark?slug=liveclawbench-medium · How It Works · Data refreshed daily, snapshot 2026-10-07.