BALSAM - Factuality: leaderboard

Metric: Overall score (0-100, LLM-judged generation and multiple choice). Source: benchmarks.ksaa.gov.sa. 29 models tracked.

Top models

#ModelScore
1Gemma 4 31B (IT)29.11
2Command A 03 202526.56
3Qwen 3 235B A22B25.67
4GLM-5 (Thinking)25.44
5GLM-4.7 (Reasoning)25.44
6Jais-2-70B-Chat25.44
7DeepSeek V3.224.78
8GPT-5.224.55
9Claude Opus 4.523.11
10Fanar-C-2-27B22.11
11Command-R+21
12Llama 4 Maverick Instruct20.89
13Kimi K2 Instruct (0905)20.89
14Yehia-7B-preview20.33
15AceGPT-v2-8B-Chat20.22

Interactive version: theaggregate.ai/benchmark?slug=balsam-factuality · How It Works · Data refreshed daily, snapshot 2026-09-19.