OpenAI MentalHealthBench - Behavior - Interpretation: leaderboard

Metric: Axis score, normalized to its possible range (%). Source: openai.com. Saturation forecast: Around 2029. 15 models tracked.

Top models

#ModelScore
1GPT-6 Luna79.62
2GPT-679.39
3GPT-6 Sol78.94
4GPT-5.6 Luna (August 2026)69.91
5GPT-5.6 Sol (August 2026)69.29
6Claude Opus 5.563.07
7Grok 4.758.98
8Claude Sonnet 558.7
9GPT-4o (Mar 2025)56.93
10Claude Haiku 4.554.52
11Claude Fable 5.154.15
12Muse Spark 1.348.92
13Gemini 2.5 Pro42.84
14Gemini 3.8 Flash39.58
15Gemini 3.1 Pro (Preview)36.37

Interactive version: theaggregate.ai/benchmark?slug=openai-mentalhealthbench-behavior-interpretation · How It Works · Data refreshed daily, snapshot 2026-09-24.