ClawBench: leaderboard

Metric: Reward (Lenient) (%). Source: benchmarklist.com. 14 models tracked.

Top models

#ModelScore
1Claude Opus 4.661.4
2Claude Sonnet 4.656.9
3Claude Opus 4.744.6
4GPT-5.535.4
5GLM-5.134.6
6DeepSeek V4 Pro33.9
7Claude Haiku 4.5 (20251001)30.1
8GPT-5.4 (2026-03-05)25.5
9GPT-5.4 Mini24.8
10Kimi K2.517.6
11GLM 4.5 Air2.3
12DeepSeek V4 Flash2.3
13MiniMax-M2.51.5

Interactive version: theaggregate.ai/benchmark?slug=clawbench · How It Works · Data refreshed daily, snapshot 2026-09-19.