Arabic Broad Leaderboard - Writing (incl Dialects): leaderboard

Metric: Average Score (0-10). Source: huggingface.co. 111 models tracked.

Top models

#ModelScore
1GPT-4o8.55
2Claude Sonnet 4 (20250514)8.09
3GPT-4.1 Mini8
4GPT-5.28
5Claude Opus 4.1 (20250805)8
6Gemini 2.0 Flash7.96
7Gemini 2.5 Pro (Preview 05-06)7.96
8GPT-6 Pro7.96
9GPT-57.91
10GPT-OSS-120B7.91
11Claude Opus 4.77.91
12Claude Opus 4 (20250514)7.91
13Claude Fable 57.91
14Qwen3.8 2.4T A95B7.91
15GPT-5 Mini7.86

Interactive version: theaggregate.ai/benchmark?slug=arabic-broad-leaderboard-writing-incl-dialects · How It Works · Data refreshed daily, snapshot 2026-09-19.