OpenAI MentalHealthBench - Behavior - Actionable Guidance: leaderboard

Metric: Axis score, normalized to its possible range (%). Source: openai.com. Saturation forecast: Around 2030. 15 models tracked.

Top models

#ModelScore
1Claude Haiku 4.572.43
2GPT-672.22
3GPT-6 Sol71.23
4GPT-5.6 Sol (August 2026)70.81
5GPT-6 Luna70.77
6Grok 4.769.65
7GPT-5.6 Luna (August 2026)69.51
8Claude Opus 5.569.44
9Claude Sonnet 569.34
10Claude Fable 5.169.25
11Muse Spark 1.368.65
12Gemini 3.8 Flash65.76
13GPT-4o (Mar 2025)64.78
14Gemini 3.1 Pro (Preview)61.65
15Gemini 2.5 Pro61.61

Interactive version: theaggregate.ai/benchmark?slug=openai-mentalhealthbench-behavior-actionable-guidance · How It Works · Data refreshed daily, snapshot 2026-09-24.