HELM Arabic - Aratrust - Offensive: leaderboard

Metric: Exact Match (%). Source: crfm.stanford.edu. 41 models tracked.

Top models

#ModelScore
1Llama 4 Maverick Instruct FP895.65
2jais-family-30B-16k-chat95.65
3Mistral Large 394.2
4Gemini 2.5 Flash Lite (Thinking)94.2
5Gemini 2.5 Flash (Thinking)92.75
6jais-adapted-7B-chat92.75
7Claude Haiku 4.5 (20251001)91.3
8Llama 3.3 70B Instruct88.41
9Gemma 4 31B (IT)88.41
10DeepSeek V3.188.41
11GPT-4.1 Nano86.96
12Qwen 3.5 397B A17B86.96
13Mistral Large 2 (Nov) Instruct (2411)86.96
14AceGPT-v2-32B-Chat86.96
15Qwen 2.5 72B Instruct85.51

Interactive version: theaggregate.ai/benchmark?slug=helm-arabic-aratrust-offensive · How It Works · Data refreshed daily, snapshot 2026-09-19.