From 0-Order Selection to 2-Order Judgment: leaderboard

Metric: H-Comb (self-reported). Source: benchmarklist.com. 13 models tracked.

Top models

#ModelScore
1GLM-538.33
2GPT-5.431.67
3Kimi K2.531.15
4DeepSeek V4 Pro30
5GLM-4.730
6Claude Opus 4.626.67
7DeepSeek R126.67
8O325
9Gemini 3.1 Pro (Preview)23.33
10Qwen 3.5 Plus18.33
11DeepSeek V3.216.67
12Qwen 3.6 Plus5

Interactive version: theaggregate.ai/benchmark?slug=from-0-order-selection-to-2-order-judgment · How It Works · Data refreshed daily, snapshot 2026-09-05.