Arabic Broad Leaderboard - Trust & Safety: leaderboard

Metric: Average Score (0-10). Source: huggingface.co. 111 models tracked.

Top models

#ModelScore
1GPT-5.510
2GLM-510
3Claude Sonnet 4 (20250514)10
4Muse Spark 1.110
5GPT-6 Pro10
6GPT-4o9.67
7Gemini 3.1 Pro (Preview)9.67
8Qwen 3.6 Max Preview9.67
9Qwen3.8 2.4T A95B9.67
10Muse Glimmer 30B9.67
11GPT-59.33
12Qwen 2.5 72B Instruct9.33
13GPT-5 Nano9.33
14GPT-5.29.33
15Gemini 3 Pro (Preview)9.33

Interactive version: theaggregate.ai/benchmark?slug=arabic-broad-leaderboard-trust-safety · How It Works · Data refreshed daily, snapshot 2026-09-19.