BALSAM - Logic: leaderboard

Metric: Overall score (0-100, LLM-judged generation and multiple choice). Source: benchmarks.ksaa.gov.sa. 29 models tracked.

Top models

#ModelScore
1Gemma 4 31B (IT)53.1
2GLM-5 (Thinking)42.41
3GLM-4.7 (Reasoning)40.51
4GPT-5.240.2
5MiniMax M3 (Reasoning)38.55
6Kimi K2 Instruct (0905)38.31
7AceGPT-v2-8B-Chat38.08
8Command A 03 202536.34
9Llama 4 Maverick Instruct36.33
10DeepSeek V3.235.75
11Qwen 3 235B A22B35.63
12Fanar-C-2-27B35.18
13Llama 3.3 70B Instruct35.06
14Grok 4.1 Fast (Reasoning)34.74
15Jais-2-70B-Chat34.01

Interactive version: theaggregate.ai/benchmark?slug=balsam-logic · How It Works · Data refreshed daily, snapshot 2026-09-19.