HiL-Bench — leaderboard

Scale Human-in-Loop benchmark measuring when agents should ask for help, escalate uncertainty, or continue autonomously.

Metric: Combined Pass@3 (%). Source: labs.scale.com. Status: saturation imminent. 15 models tracked.

Top models

#ModelScore
1Claude Fable 556.33
2GLM-5.243.67
3Claude Opus 4.741.67
4GPT-5.539.67
5Claude Opus 4.638.33
6Gemini 3.1 Pro (Preview)35.33
7Claude Opus 4.835.33
8GPT-5.6 Sol32.33
9Gemini 3.5 Flash27.67
10GLM-5.121
11Grok 4.2020
12Kimi K2.618.67
13GPT-5.49.67
14MiniMax-M2.56.33
15GPT-5.3 Codex4.33

Interactive version: theaggregate.ai/benchmark?slug=hil-bench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.