ALARB: leaderboard

Arabic Legal Argument Reasoning Benchmark for evaluating LLM reasoning over Saudi commercial court cases and legal arguments.

Metric: Facts+regulations correct (self-reported). Source: benchmarklist.com. Status: saturated. 12 models tracked.

Top models

#ModelScore
1GPT-4o46
2Qwen 3 14B44.6
3aya-expanse-32B36.3
4Qwen 3 8B32.2
5Gemma 3 12B (IT)29.6
6O4 Mini27.6
7aya-expanse-8B24.6
8Gemma 3 4B (IT)24.5

Interactive version: theaggregate.ai/benchmark?slug=alarb · How It Works · Data refreshed daily, snapshot 2026-09-05.