Arabic Broad Leaderboard - Translation (incl Dialects): leaderboard

Metric: Average Score (0-10). Source: huggingface.co. 111 models tracked.

Top models

#ModelScore
1GPT-4o8.39
2GPT-5.28.17
3GPT-6 Pro8.17
4GPT-5.58.06
5Gemini 3.5 Flash8.06
6GPT-5.6 Pro Sol8.06
7Muse Spark 1.17.97
8Gemini 3.1 Pro (Preview)7.94
9GPT-57.92
10Claude Sonnet 4 (20250514)7.92
11Claude Opus 4.77.89
12Gemma 4 26B A4B (IT)7.89
13Gemini 3.7 Flash7.89
14Gemma 4 31B (IT)7.86
15Claude Opus 4.1 (20250805)7.86

Interactive version: theaggregate.ai/benchmark?slug=arabic-broad-leaderboard-translation-incl-dialects · How It Works · Data refreshed daily, snapshot 2026-09-19.