CLBench - Domain Knowledge Reasoning: leaderboard

Metric: Solving Rate (%). Source: www.clbench.com. 36 models tracked.

Top models

#ModelScore
1GPT-5.4 (xHigh)28.8
2GPT-5.1 (High)25.3
3Hy3-preview25.2
4Grok 4.20 (Reasoning)23.9
5Claude Opus 4.5 (Thinking)23.7
6GPT-5.122.4
7Qwen 3.6 Plus22.2
8Qwen 3.5 Plus (Thinking)22
9Gemini 3.1 Pro (Preview) (High)21.1
10Claude Opus 4.521
11Seed 2.0 Pro (High)21
12Kimi K2.520.8
13GLM-520.8
14Claude Opus 4.620.4
15Seed 2.0 Pro (Medium)20.1

Interactive version: theaggregate.ai/benchmark?slug=clbench-domain-knowledge-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-19.