BALSAM - Question Answering: leaderboard

Metric: Overall score (0-100, LLM-judged generation and multiple choice). Source: benchmarks.ksaa.gov.sa. 29 models tracked.

Top models

#ModelScore
1Gemma 4 31B (IT)84.39
2GPT-5.273.98
3GLM-4.7 (Reasoning)73.95
4GLM-5 (Thinking)73.39
5Command A 03 202572.2
6DeepSeek V3.271.65
7Fanar-C-2-27B70.35
8AceGPT-v2-8B-Chat69.83
9Kimi K2 Instruct (0905)68.97
10Llama 3.3 70B Instruct67.31
11MiniMax M3 (Reasoning)67.24
12Llama 4 Maverick Instruct65.44
13Jais-2-70B-Chat65.17
14Qwen 3 235B A22B60.48
15Grok 4.1 Fast (Reasoning)59.91

Interactive version: theaggregate.ai/benchmark?slug=balsam-question-answering · How It Works · Data refreshed daily, snapshot 2026-09-19.