RealClawBench - Pass@3: leaderboard

Metric: Pass@3 (%): share of the 281 tasks solved in at least one of three runs, on 281 released tasks reconstructed from real OpenClaw developer-agent sessions, run in the shared OpenClaw agent runtime (file read, write, edit, search and shell tools, 600-second timeout, temperature 1.0) and scored by case-specific deterministic Python verifiers; mean of three independent runs; higher is better. Source: arxiv.org. Saturation forecast: Around December 2026. 14 models tracked.

Top models

#ModelScore
1DeepSeek V4 Pro76.2
2GPT-5.575.1
3Claude Opus 4.775.1
4MiMo-V2.5-Pro74.7
5Kimi K2.673
6DeepSeek V4 Flash71.2
7GLM-5.170.8
8Claude Sonnet 4.670.5
9Gemini 3.1 Pro (Preview)69
10MiniMax-M2.768.3
11Qwen 3.6 Plus67.6
12Claude Opus 4.667.3
13GPT-OSS-120B57.7
14Gemma 4 31B51.6

Interactive version: theaggregate.ai/benchmark?slug=realclawbench-pass-3 · How It Works · Data refreshed daily, snapshot 2026-09-29.