HealthBench-Psych: leaderboard

Metric: Three-Judge Panel Mean Rubric Score (%). Source: github.com. 21 models tracked.

Top models

#ModelScore
1Kimi K2.662.7
2GPT-5.562.39
3Claude Fable 5.162.08
4Claude Opus 561.96
5Grok 4.561.22
6GPT-5.6 Sol60.96
7Claude Fable 559.09
8GPT-658.48
9Gemini 3.6 Flash57.83
10Gemini 3.8 Flash56.82
11Kimi K356.81
12DeepSeek V4 Pro55.43
13Qwen 3.7 Plus55.18
14DeepSeek V4 Flash53.81
15Claude Sonnet 553.32

Interactive version: theaggregate.ai/benchmark?slug=healthbench-psych · How It Works · Data refreshed daily, snapshot 2026-09-19.