ALARB — leaderboard

Arabic Legal Argument Reasoning Benchmark for evaluating LLM reasoning over Saudi commercial court cases and legal arguments.

Metric: Facts+regulations correct (self-reported). Source: benchmarklist.com. Status: saturation imminent. 12 models tracked.

Top models

#ModelScore
1GPT-4o46
2Qwen 3 14B44.6
3aya-expanse-32B36.3
4Qwen 3 8B32.2
5Gemma 3 12B29.6
6O4 Mini27.6
7aya-expanse-8B24.6
8Gemma 3 4B24.5

Interactive version: theaggregate.ai/benchmark?slug=alarb · How the rankings work · Data refreshed daily, snapshot 2026-07-22.