BALSAM - Fill in the Blank: leaderboard

Metric: Overall score (0-100, LLM-judged generation and multiple choice). Source: benchmarks.ksaa.gov.sa. 29 models tracked.

Top models

#ModelScore
1Gemma 4 31B (IT)95.96
2GPT-5.285.61
3GLM-4.7 (Reasoning)82.88
4Claude Opus 4.581.87
5Grok 4.1 Fast (Reasoning)81.69
6GLM-5 (Thinking)79.58
7Llama 4 Maverick Instruct78.77
8Qwen 3 235B A22B78.75
9AceGPT-v2-8B-Chat77.64
10DeepSeek V3.277.2
11Kimi K2 Instruct (0905)76.08
12Command-R+76.01
13Fanar-C-2-27B75.46
14Command A 03 202572.85
15Llama 3.3 70B Instruct72.04

Interactive version: theaggregate.ai/benchmark?slug=balsam-fill-in-the-blank · How It Works · Data refreshed daily, snapshot 2026-09-19.