RealClawBench: leaderboard

Metric: Case-level verifier pass rate (%, sample micro-average) on 281 released tasks reconstructed from real OpenClaw developer-agent sessions, run in the shared OpenClaw agent runtime (file read, write, edit, search and shell tools, 600-second timeout, temperature 1.0) and scored by case-specific deterministic Python verifiers; mean of three independent runs; higher is better. Source: arxiv.org. Saturation forecast: Around November 2027. 14 models tracked.

Top models

#ModelScore
1Claude Opus 4.765.8
2GPT-5.565
3MiMo-V2.5-Pro60.1
4DeepSeek V4 Pro59.8
5Kimi K2.657.7
6Gemini 3.1 Pro (Preview)57.4
7GLM-5.157.4
8DeepSeek V4 Flash56
9Qwen 3.6 Plus55.8
10Claude Sonnet 4.655.3
11MiniMax-M2.753.7
12Claude Opus 4.652.1
13Gemma 4 31B45.7
14GPT-OSS-120B42.7

Interactive version: theaggregate.ai/benchmark?slug=realclawbench · How It Works · Data refreshed daily, snapshot 2026-09-29.