Arabic Broad Leaderboard - Reasoning & Math: leaderboard

Metric: Average Score (0-10). Source: huggingface.co. 111 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)9.77
2Qwen 3.5 27B9.77
3Gemini 3.5 Flash9.77
4Gemini 3 Pro (Preview)9.74
5Gemini 3.7 Flash9.72
6GPT-4o9.61
7GLM-5.19.54
8Gemini 2.5 Pro (Preview 05-06)9.54
9Muse Spark 1.19.47
10GPT-59.3
11DeepSeek V4 Pro9.3
12Qwen 3.5 397B A17B9.3
13Gemini 3.1 Flash Lite9.3
14GLM-59.3
15Gemini 3.5 Flash Lite9.3

Interactive version: theaggregate.ai/benchmark?slug=arabic-broad-leaderboard-reasoning-math · How It Works · Data refreshed daily, snapshot 2026-09-19.