WeClawArena - No-Attacker Task Success: leaderboard
Metric: Task success rate (%; the benign no-attacker control run of all 124 base tasks across the six domains, deterministic check of the final multi-workspace state; each model drives every owner agent in the Dockerized OpenClaw runtime; solved count out of 124 scaled to percent). Source: arxiv.org. Saturation forecast: Rough model projection: around 2026. 8 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Claude Opus 4.7 (OpenClaw) | 61.29 |
| 2 | Kimi K2.5 (OpenClaw) | 51.61 |
| 3 | Claude Sonnet 4.5 (OpenClaw) | 48.39 |
| 4 | DeepSeek V3.2 (OpenClaw) | 34.68 |
| 5 | Claude Opus 4.1 (OpenClaw) | 32.26 |
| 6 | Qwen3 235B (OpenClaw) | 29.03 |
| 7 | Qwen3 32B (OpenClaw) | 20.97 |
| 8 | Kimi K2 Thinking (OpenClaw) | 20.16 |
Interactive version: theaggregate.ai/benchmark?slug=weclawarena-no-attacker-task-success · How It Works · Data refreshed daily, snapshot 2026-09-26.