OpenAI MentalHealthBench - Acuity - High Acuity: leaderboard

Metric: Task-clipped rubric score (%). Source: openai.com. Saturation forecast: Around 2031. 17 models tracked.

Top models

#ModelScore
1GPT-657.92
2GPT-6 Sol57
3Muse Spark 1.355.5
4GPT-5.6 Sol (August 2026)53.59
5GPT-6 Luna53.32
6Claude Opus 5.552.81
7GPT-5.6 Luna (August 2026)52.34
8Claude Fable 5.150.53
9GPT-5 (Thinking)50.3
10Claude Sonnet 548.66
11Grok 4.744.28
12Claude Haiku 4.543.71
13Gemini 3.8 Flash41.3
14Gemini 3.1 Pro (Preview)38.49
15Gemini 2.5 Flash37.7

Interactive version: theaggregate.ai/benchmark?slug=openai-mentalhealthbench-acuity-high-acuity · How It Works · Data refreshed daily, snapshot 2026-09-24.