OpenAI MentalHealthBench - Behavior - Harm Avoidance: leaderboard

Metric: Axis score, normalized to its possible range (%). Source: openai.com. Saturation forecast: Around March 2028. 15 models tracked.

Top models

#ModelScore
1Muse Spark 1.382.29
2Grok 4.779.35
3GPT-6 Sol72.37
4GPT-6 Luna71.61
5GPT-670.84
6Claude Opus 5.566.22
7Gemini 3.8 Flash61.55
8GPT-5.6 Luna (August 2026)60.91
9GPT-5.6 Sol (August 2026)59.27
10Claude Fable 5.159.19
11Claude Haiku 4.555.16
12GPT-4o (Mar 2025)50.56
13Claude Sonnet 548.58
14Gemini 3.1 Pro (Preview)45.27
15Gemini 2.5 Pro37.07

Interactive version: theaggregate.ai/benchmark?slug=openai-mentalhealthbench-behavior-harm-avoidance · How It Works · Data refreshed daily, snapshot 2026-09-24.