HELM Arabic - Alghafa - Multiple Choice Rating Sentiment No Neutral Task: leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.686.3
2Claude Opus 4.786
3GPT-4.1 (2025-04-14)84.4
4Llama 4 Maverick Instruct FP884.1
5Llama 4 Scout Instruct82.8
6Llama 3.3 70B Instruct82.4
7jais-adapted-7B-chat82
8Gemini 2.5 Flash Lite (Thinking)81.7
9Claude Haiku 4.5 (20251001)81.5
10Mistral Large 2 (Nov) Instruct (2411)81.2
11ALLaM-7B-Instruct-preview81
12jais-adapted-70B-chat80.3
13Gemma 4 31B (IT)79.9
14Qwen 3.5 397B A17B79.5
15AceGPT-v2-32B-Chat79.5

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-alghafa-multiple-choice-rating-sentiment-no-neutral-task · How It Works · Data refreshed daily, snapshot 2026-09-19.