Arabic Broad Leaderboard - RAG QA: leaderboard

Metric: Average Score (0-10). Source: huggingface.co. 111 models tracked.

Top models

#ModelScore
1GLM-5.39.73
2Gemini 2.5 Pro (Preview 05-06)9.71
3Kimi K39.54
4Muse Spark 1.19.51
5Gemini 3.1 Pro (Preview)9.46
6GPT-5.6 Pro Sol9.46
7GPT-5.59.41
8Gemini 3 Pro (Preview)9.41
9Gemini 2.5 Flash (Preview 04-17)9.32
10Gemini 3.5 Flash9.29
11O39.22
12GLM-59.17
13Qwen3.8 2.4T A95B9.05
14GPT-58.71
15Gemini 3.7 Flash8.66

Interactive version: theaggregate.ai/benchmark?slug=arabic-broad-leaderboard-rag-qa · How It Works · Data refreshed daily, snapshot 2026-09-19.