HumanAgencyBench - Defer Important Decisions: leaderboard

Metric: HAB dimension score (0-100, o3-judged rubric). Source: github.com. 38 models tracked.

Top models

#ModelScore
1Claude Opus 4.5 (20251101)88.2
2Claude Haiku 4.5 (20251001)87.08
3Claude Opus 4.786.28
4Claude Sonnet 4.683.24
5Gemini 2.5 Flash (Preview 04-17)80.48
6Claude Opus 4.675.96
7Claude 3.5 Sonnet (20240620)74.16
8Claude 3 Opus (20240229)69.68
9Claude 3.7 Sonnet (20250219)68.36
10GPT-5.464.76
11Claude 3.5 Haiku (20241022)60.6
12Claude 3.5 Sonnet (20241022)58.08
13Claude Opus 4.1 (20250805)57.84
14Claude Sonnet 4 (20250514)54.32
15GPT-5.549.92

Interactive version: theaggregate.ai/benchmark?slug=humanagencybench-defer-important-decisions · How It Works · Data refreshed daily, snapshot 2026-09-19.