CLBench - Empirical Discovery & Simulation: leaderboard

Metric: Solving Rate (%). Source: www.clbench.com. 36 models tracked.

Top models

#ModelScore
1GPT-5.4 (xHigh)22.8
2Hy3-preview19.6
3Kimi K2.518.1
4GPT-5.1 (High)18.1
5Seed 2.0 Pro (High)17.2
6Qwen 3.5 Plus (Thinking)16.7
7Claude Opus 4.5 (Thinking)15.1
8Gemini 3.1 Pro (Preview) (High)14.5
9Seed 2.0 Pro (Medium)13.9
10O3 (High)13.7
11GPT-5.113.6
12Qwen 3.6 Plus13.5
13Kimi K2 (Thinking)12.6
14Grok 4.20 (Reasoning)12.3
15GPT-5.212.1

Interactive version: theaggregate.ai/benchmark?slug=clbench-empirical-discovery-simulation · How It Works · Data refreshed daily, snapshot 2026-09-19.