HealthBench-Psych - Hard: leaderboard

Metric: Three-Judge Panel Mean Rubric Score (%). Source: github.com. 20 models tracked.

Top models

#ModelScore
1Claude Opus 541.51
2GPT-5.6 Sol40.8
3Kimi K2.640.76
4GPT-5.540.39
5GPT-639.73
6Claude Fable 5.138.74
7Grok 4.537.75
8Claude Fable 535.06
9Gemini 3.8 Flash32.47
10Gemini 3.6 Flash31.76
11DeepSeek V4 Pro31.43
12Kimi K331.03
13Claude Sonnet 529.93
14DeepSeek V4 Flash28.21
15Qwen 3.7 Plus27.36

Interactive version: theaggregate.ai/benchmark?slug=healthbench-psych-hard · How It Works · Data refreshed daily, snapshot 2026-09-19.