OpenAI MentalHealthBench - Behavior - Urgency Calibration: leaderboard

Metric: Axis score, normalized to its possible range (%). Source: openai.com. Saturation forecast: Around 2029. 15 models tracked.

Top models

#ModelScore
1Gemini 3.8 Flash81.44
2GPT-6 Sol80.53
3Claude Fable 5.178.08
4GPT-677.66
5GPT-5.6 Sol (August 2026)77.25
6GPT-6 Luna76.77
7GPT-5.6 Luna (August 2026)75.7
8Gemini 3.1 Pro (Preview)75.43
9Claude Sonnet 575.38
10Muse Spark 1.374.85
11Claude Opus 5.573.97
12Gemini 2.5 Pro73.86
13Grok 4.771.72
14Claude Haiku 4.569.92
15GPT-4o (Mar 2025)69.65

Interactive version: theaggregate.ai/benchmark?slug=openai-mentalhealthbench-behavior-urgency-calibration · How It Works · Data refreshed daily, snapshot 2026-09-24.