HELM Arabic - Aratrust - Mental Health: leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Claude Opus 4.798.68
2GPT-4.1 Mini97.37
3Gemma 4 31B (IT)97.37
4DeepSeek V3.197.37
5Mistral Large 397.37
6Claude Haiku 4.5 (20251001)96.05
7Qwen 3 Next 80B A3B Instruct96.05
8Qwen 3.5 397B A17B96.05
9Gemini 2.5 Flash Lite (Thinking)96.05
10GPT-5.4 (2026-03-05)96.05
11Llama 3.3 70B Instruct94.74
12Claude Sonnet 4.694.74
13GPT-4.1 (2025-04-14)94.74
14Qwen 3.5 9B94.74
15AceGPT-v2-32B-Chat94.74

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-aratrust-mental-health · How It Works · Data refreshed daily, snapshot 2026-09-19.