WeClawArena - No-Attacker Task Success: leaderboard

Metric: Task success rate (%; the benign no-attacker control run of all 124 base tasks across the six domains, deterministic check of the final multi-workspace state; each model drives every owner agent in the Dockerized OpenClaw runtime; solved count out of 124 scaled to percent). Source: arxiv.org. Saturation forecast: Rough model projection: around 2026. 8 models tracked.

Top models

#ModelScore
1Claude Opus 4.7 (OpenClaw)61.29
2Kimi K2.5 (OpenClaw)51.61
3Claude Sonnet 4.5 (OpenClaw)48.39
4DeepSeek V3.2 (OpenClaw)34.68
5Claude Opus 4.1 (OpenClaw)32.26
6Qwen3 235B (OpenClaw)29.03
7Qwen3 32B (OpenClaw)20.97
8Kimi K2 Thinking (OpenClaw)20.16

Interactive version: theaggregate.ai/benchmark?slug=weclawarena-no-attacker-task-success · How It Works · Data refreshed daily, snapshot 2026-09-26.