BALSAM - Overall: leaderboard
Metric: Mean of category overall scores (0-100). Source: benchmarks.ksaa.gov.sa. 28 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Gemma 4 31B (IT) | 69.64 |
| 2 | GPT-5.2 | 59.61 |
| 3 | GLM-5 (Thinking) | 59.29 |
| 4 | GLM-4.7 (Reasoning) | 58.01 |
| 5 | AceGPT-v2-8B-Chat | 55.9 |
| 6 | DeepSeek V3.2 | 55.33 |
| 7 | Command A 03 2025 | 55.16 |
| 8 | Grok 4.1 Fast (Reasoning) | 55.03 |
| 9 | Kimi K2 Instruct (0905) | 54.57 |
| 10 | Qwen 3 235B A22B | 53.84 |
| 11 | Fanar-C-2-27B | 53.17 |
| 12 | Llama 4 Maverick Instruct | 52.92 |
| 13 | MiniMax M3 (Reasoning) | 52.79 |
| 14 | Llama 3.3 70B Instruct | 52.25 |
| 15 | Claude Opus 4.5 | 50.62 |
Interactive version: theaggregate.ai/benchmark?slug=balsam-overall · How It Works · Data refreshed daily, snapshot 2026-09-19.