BALSAM - Program Execution: leaderboard

Metric: Overall score (0-100, LLM-judged generation and multiple choice). Source: benchmarks.ksaa.gov.sa. 29 models tracked.

Top models

#ModelScore
1Gemma 4 31B (IT)98.45
2Grok 4.1 Fast (Reasoning)95.79
3MiniMax M3 (Reasoning)94.45
4AceGPT-v2-8B-Chat93.78
5GLM-4.7 (Reasoning)92.43
6GLM-5 (Thinking)91.78
7GPT-5.290.49
8Kimi K2 Instruct (0905)81.85
9DeepSeek V3.281.61
10Command A 03 202578.94
11Llama 3.3 70B Instruct77.19
12Qwen 3 235B A22B73.39
13Fanar-C-2-27B71.43
14Llama 4 Maverick Instruct64.34
15Jais-2-70B-Chat63.2

Interactive version: theaggregate.ai/benchmark?slug=balsam-program-execution · How It Works · Data refreshed daily, snapshot 2026-09-19.