Arabic Broad Leaderboard: leaderboard

Arabic broad-capability leaderboard scoring models across categories and formats.

Metric: Average Score (0-10). Source: huggingface.co. Status: saturated. 110 models tracked.

Top models

#ModelScore
1Gemini 3.5 Flash9.25
2Gemini 3.1 Pro (Preview)9.21
3Gemini 3 Pro (Preview)9.2
4Gemini 3.7 Flash9.2
5Muse Spark 1.19.2
6Gemini 3.1 Flash Lite9.14
7GLM-59.06
8GPT-4o9.02
9Gemini 2.5 Pro (Preview 05-06)8.99
10Gemma 4 31B (IT)8.98
11GPT-5.58.98
12Gemini 2.5 Flash (Preview 04-17)8.97
13GPT-5.6 Pro Sol8.97
14O38.96
15GPT-58.96

Interactive version: theaggregate.ai/benchmark?slug=arabic-broad-leaderboard · How It Works · Data refreshed daily, snapshot 2026-09-05.