BALSAM - Reading Comprehension: leaderboard

Metric: Overall score (0-100, LLM-judged generation and multiple choice). Source: benchmarks.ksaa.gov.sa. 29 models tracked.

Top models

#ModelScore
1Gemma 4 31B (IT)68.41
2DeepSeek V3.263.43
3Command A 03 202559.8
4GPT-5.259.13
5DeepSeek V4 Pro (Reasoning)58.55
6Command-R+58.16
7Qwen 3 235B A22B57.43
8AceGPT-v2-8B-Chat55.97
9Yehia-7B-preview54.72
10Llama 4 Maverick Instruct52.58
11GLM-5 (Thinking)52.5
12Fanar-C-2-27B52.34
13Claude Opus 4.552.06
14Kimi K2 Instruct (0905)51.11
15GLM-4.7 (Reasoning)50.97

Interactive version: theaggregate.ai/benchmark?slug=balsam-reading-comprehension · How It Works · Data refreshed daily, snapshot 2026-09-19.