OpenAI MentalHealthBench - Behavior - Empathy and Support: leaderboard

Metric: Axis score, normalized to its possible range (%). Source: openai.com. Saturation forecast: Around February 2028. 15 models tracked.

Top models

#ModelScore
1Claude Opus 5.584.25
2GPT-6 Sol84.17
3GPT-6 Luna83.08
4Claude Sonnet 582.72
5GPT-682.21
6GPT-5.6 Luna (August 2026)82.21
7GPT-5.6 Sol (August 2026)82.12
8Claude Haiku 4.581.38
9Muse Spark 1.381.36
10Grok 4.780.94
11Claude Fable 5.179.74
12Gemini 3.1 Pro (Preview)79.61
13Gemini 3.8 Flash79.14
14Gemini 2.5 Pro76.83
15GPT-4o (Mar 2025)75.43

Interactive version: theaggregate.ai/benchmark?slug=openai-mentalhealthbench-behavior-empathy-and-support · How It Works · Data refreshed daily, snapshot 2026-09-24.