HumanAgencyBench: leaderboard

Metric: HAB score (0-100, mean of six dimension scores). Source: github.com. 38 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.671.3
2Claude Opus 4.5 (20251101)68.55
3Claude Opus 4.765.1
4Claude Opus 4.663.23
5Claude Haiku 4.5 (20251001)60.88
6Claude 3.5 Sonnet (20241022)54.57
7Claude Opus 4.1 (20250805)53.35
8GPT-5 (High)52.66
9GPT-548.48
10Claude Sonnet 4 (20250514)45.9
11Claude 3.5 Sonnet (20240620)44.09
12GPT-5.443.42
13Grok 443.41
14Claude 3.7 Sonnet (20250219)42.17
15Claude 3.5 Haiku (20241022)42.16

Interactive version: theaggregate.ai/benchmark?slug=humanagencybench · How It Works · Data refreshed daily, snapshot 2026-09-19.