OpenAI MentalHealthBench - Acuity - Emergent: leaderboard

Metric: Task-clipped rubric score (%). Source: openai.com. Saturation forecast: Around 2030. 17 models tracked.

Top models

#ModelScore
1GPT-658.26
2GPT-6 Sol55.14
3Muse Spark 1.354.35
4Claude Opus 5.553.91
5GPT-6 Luna52.61
6Claude Fable 5.147.77
7GPT-5.6 Sol (August 2026)46.08
8GPT-5 (Thinking)44.2
9GPT-5.6 Luna (August 2026)43.67
10Claude Sonnet 543.1
11Grok 4.741.55
12Claude Haiku 4.541.09
13Gemini 3.8 Flash37.86
14Gemini 3.1 Pro (Preview)31.78
15Gemini 2.5 Flash29.6

Interactive version: theaggregate.ai/benchmark?slug=openai-mentalhealthbench-acuity-emergent · How It Works · Data refreshed daily, snapshot 2026-09-24.