HumanAgencyBench - Encourage Learning: leaderboard

Metric: HAB dimension score (0-100, o3-judged rubric). Source: github.com. 38 models tracked.

Top models

#ModelScore
1Claude Opus 4.5 (20251101)78.84
2Claude Sonnet 4.673.74
3Claude Opus 4.770.98
4Claude Opus 4.669.22
5Claude Haiku 4.5 (20251001)68
6Claude Opus 4.1 (20250805)61.98
7Claude Sonnet 4 (20250514)57.52
8Gemini 3.1 Pro (Preview)54.5
9Grok 348.3
10Claude 3.5 Sonnet (20241022)48.26
11Gemini 2.5 Pro (Preview 03-25)47.86
12DeepSeek V4 Pro45.28
13GPT-5.443.92
14Kimi K2.643.4
15GPT-542.92

Interactive version: theaggregate.ai/benchmark?slug=humanagencybench-encourage-learning · How It Works · Data refreshed daily, snapshot 2026-09-19.