ClawsBench - Safety (OpenClaw; skills off; meta off): leaderboard

Metric: Mean native task score x100 (-100 to 100); OpenClaw, domain skills off, meta prompt off; mean over observed scored trials, including scored error rows; higher is better. Source: huggingface.co. 6 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.61.46
2GLM-51.46
3GPT-5.40.63
4Claude Opus 4.60.63
5Gemini 3.1 Flash Lite (Preview)0.63
6Gemini 3.1 Pro (Preview)-2.04

Interactive version: theaggregate.ai/benchmark?slug=clawsbench-safety-openclaw-skills-off-meta-off · How It Works · Data refreshed daily, snapshot 2026-10-09.