OpenAI MentalHealthBench - Behavior - User Agency: leaderboard

Metric: Axis score, normalized to its possible range (%). Source: openai.com. Saturation forecast: Around 2031. 15 models tracked.

Top models

#ModelScore
1Claude Sonnet 567.09
2Claude Opus 5.563.54
3Muse Spark 1.362.69
4Claude Haiku 4.561.4
5GPT-4o (Mar 2025)59.51
6GPT-659.18
7Claude Fable 5.158.49
8GPT-6 Sol58.3
9GPT-6 Luna58.26
10Grok 4.755.82
11GPT-5.6 Sol (August 2026)54.51
12GPT-5.6 Luna (August 2026)53.02
13Gemini 3.8 Flash50.43
14Gemini 2.5 Pro49.03
15Gemini 3.1 Pro (Preview)45.4

Interactive version: theaggregate.ai/benchmark?slug=openai-mentalhealthbench-behavior-user-agency · How It Works · Data refreshed daily, snapshot 2026-09-24.