OpenAI MentalHealthBench - Behavior - Clinical Accuracy: leaderboard

Metric: Axis score, normalized to its possible range (%). Source: openai.com. Saturation forecast: Around 2029. 15 models tracked.

Top models

#ModelScore
1GPT-682.6
2GPT-6 Luna80.55
3GPT-6 Sol79.99
4GPT-5.6 Sol (August 2026)76.22
5Grok 4.775.33
6GPT-5.6 Luna (August 2026)74.73
7Muse Spark 1.371.05
8Claude Opus 5.570.69
9Claude Sonnet 566.47
10Claude Fable 5.166.42
11GPT-4o (Mar 2025)65.69
12Claude Haiku 4.564.55
13Gemini 3.8 Flash63.3
14Gemini 2.5 Pro62.08
15Gemini 3.1 Pro (Preview)61.58

Interactive version: theaggregate.ai/benchmark?slug=openai-mentalhealthbench-behavior-clinical-accuracy · How It Works · Data refreshed daily, snapshot 2026-09-24.