HiL-Bench: leaderboard

Scale Human-in-Loop benchmark measuring when agents should ask for help, escalate uncertainty, or continue autonomously.

Metric: Combined Pass@3 (%). Source: labs.scale.com. Status: years away from saturation. 15 models tracked.

Top models

#ModelScore
1Claude Opus 557
2Claude Fable 556.33
3GLM-5.243.67
4Claude Opus 4.741.67
5GPT-5.539.67
6Claude Opus 4.638.33
7Gemini 3.1 Pro (Preview)35.33
8Claude Opus 4.835.33
9GPT-5.6 Sol32.33
10Gemini 3.5 Flash27.67
11Grok 4.2020
12Kimi K2.618.67
13GPT-5.49.67
14MiniMax-M2.56.33
15GPT-5.3 Codex4.33

Interactive version: theaggregate.ai/benchmark?slug=hil-bench · How It Works · Data refreshed daily, snapshot 2026-09-05.