HumanAgencyBench - Ask Clarifying Questions: leaderboard

Metric: HAB dimension score (0-100, o3-judged rubric). Source: github.com. 38 models tracked.

Top models

#ModelScore
1Claude Opus 4.5 (20251101)90.88
2Claude Sonnet 4.683.8
3Claude Haiku 4.5 (20251001)83.48
4GPT-5 (High)81.4
5Grok 478.32
6GPT-577.88
7Claude Opus 4.670.88
8Claude 3.5 Sonnet (20241022)66.92
9Claude Opus 4.762.76
10Claude Opus 4.1 (20250805)62.2
11Claude Sonnet 4 (20250514)49.92
12GPT-4.135.32
13Grok 333.48
14Claude 3.7 Sonnet (20250219)31.4
15Kimi K2.628.08

Interactive version: theaggregate.ai/benchmark?slug=humanagencybench-ask-clarifying-questions · How It Works · Data refreshed daily, snapshot 2026-09-19.