BALSAM - Overall: leaderboard

Metric: Mean of category overall scores (0-100). Source: benchmarks.ksaa.gov.sa. 28 models tracked.

Top models

#ModelScore
1Gemma 4 31B (IT)69.64
2GPT-5.259.61
3GLM-5 (Thinking)59.29
4GLM-4.7 (Reasoning)58.01
5AceGPT-v2-8B-Chat55.9
6DeepSeek V3.255.33
7Command A 03 202555.16
8Grok 4.1 Fast (Reasoning)55.03
9Kimi K2 Instruct (0905)54.57
10Qwen 3 235B A22B53.84
11Fanar-C-2-27B53.17
12Llama 4 Maverick Instruct52.92
13MiniMax M3 (Reasoning)52.79
14Llama 3.3 70B Instruct52.25
15Claude Opus 4.550.62

Interactive version: theaggregate.ai/benchmark?slug=balsam-overall · How It Works · Data refreshed daily, snapshot 2026-09-19.