OpenAI MentalHealthBench - Behavior - Reality Testing: leaderboard

Metric: Axis score, normalized to its possible range (%). Source: openai.com. Saturation forecast: Around May 2027. 15 models tracked.

Top models

#ModelScore
1GPT-691.65
2GPT-6 Sol87.18
3GPT-6 Luna86.91
4GPT-5.6 Sol (August 2026)77.66
5GPT-5.6 Luna (August 2026)76.85
6Claude Opus 5.572.52
7Grok 4.771.37
8Claude Haiku 4.565.48
9Claude Sonnet 565.35
10Claude Fable 5.164.13
11Gemini 3.8 Flash59.36
12Muse Spark 1.354.95
13GPT-4o (Mar 2025)54.79
14Gemini 3.1 Pro (Preview)49.22
15Gemini 2.5 Pro42.16

Interactive version: theaggregate.ai/benchmark?slug=openai-mentalhealthbench-behavior-reality-testing · How It Works · Data refreshed daily, snapshot 2026-09-24.