OpenAI MentalHealthBench - Behavior - Communication: leaderboard

Metric: Axis score, normalized to its possible range (%). Source: openai.com. Saturation forecast: Around 2029. 15 models tracked.

Top models

#ModelScore
1GPT-6 Sol89.28
2GPT-6 Luna87.3
3GPT-686.05
4Claude Haiku 4.568.73
5GPT-5.6 Luna (August 2026)67.06
6GPT-4o (Mar 2025)66.84
7Claude Opus 5.565.75
8Grok 4.765.54
9Claude Fable 5.161.76
10Claude Sonnet 561.67
11GPT-5.6 Sol (August 2026)61.06
12Gemini 2.5 Pro52.62
13Muse Spark 1.351.9
14Gemini 3.8 Flash51.2
15Gemini 3.1 Pro (Preview)45

Interactive version: theaggregate.ai/benchmark?slug=openai-mentalhealthbench-behavior-communication · How It Works · Data refreshed daily, snapshot 2026-09-24.