BALSAM - Summarization: leaderboard

Metric: Overall score (0-100, LLM-judged generation and multiple choice). Source: benchmarks.ksaa.gov.sa. 29 models tracked.

Top models

#ModelScore
1Gemma 4 31B (IT)69.18
2DeepSeek V4 Pro (Reasoning)62.77
3GLM-5.255.7
4Qwen 3 235B A22B52.64
5GLM-4.7 (Reasoning)52.09
6GLM-5 (Thinking)51.9
7GPT-5.251.55
8Kimi K2 Instruct (0905)51.44
9DeepSeek V3.250.46
10AceGPT-v2-8B-Chat50.25
11Claude Opus 4.549.86
12Grok 4.1 Fast (Reasoning)49.71
13Command A 03 202549.35
14Fanar-C-2-27B49.17
15MiniMax M3 (Reasoning)49

Interactive version: theaggregate.ai/benchmark?slug=balsam-summarization · How It Works · Data refreshed daily, snapshot 2026-09-19.