ActBench - OpenClaw - Benign Utility Grading Score: leaderboard

Metric: Mean utility grading score on matched benign cases (0-1). Source: arxiv.org. 15 models tracked.

Top models

#ModelScore
1Kimi K30.94
2Claude Opus 4.80.94
3Grok 4.50.94
4GLM-5.20.93
5GPT-5.50.93
6Claude Sonnet 4.60.93
7DeepSeek V4 Pro0.92
8MiniMax-M30.92
9Qwen 3.7 Max0.92
10Qwen 3.7 Plus0.92
11GPT-5.4 Mini0.9
12DeepSeek V4 Flash0.9
13MiniMax-M2.70.88
14Kimi K2.60.87

Interactive version: theaggregate.ai/benchmark?slug=actbench-openclaw-benign-utility-grading-score · How It Works · Data refreshed daily, snapshot 2026-09-19.