CLBench - Procedural Task Execution: leaderboard

Metric: Solving Rate (%). Source: www.clbench.com. 36 models tracked.

Top models

#ModelScore
1GPT-5.4 (xHigh)30.1
2Claude Opus 4.624.4
3GPT-5.1 (High)23.8
4Gemini 3.1 Pro (Preview) (High)23.8
5Grok 4.20 (Reasoning)23.4
6GPT-5.122.8
7Claude Opus 4.5 (Thinking)22.6
8Hy3-preview22.3
9GLM-521.6
10GPT-5.2 (High)21.4
11Seed 2.0 Pro (High)21.4
12Qwen 3.6 Plus21.3
13Kimi K2.519.5
14Claude Opus 4.519.5
15O3 (High)19.5

Interactive version: theaggregate.ai/benchmark?slug=clbench-procedural-task-execution · How It Works · Data refreshed daily, snapshot 2026-09-19.