BALSAM - Translation/Transliteration: leaderboard

Metric: Overall score (0-100, LLM-judged generation and multiple choice). Source: benchmarks.ksaa.gov.sa. 29 models tracked.

Top models

#ModelScore
1Gemma 4 31B (IT)79.65
2GLM-5 (Thinking)70.18
3DeepSeek V4 Pro (Reasoning)68.53
4GPT-5.268
5Grok 4.1 Fast (Reasoning)67
6DeepSeek V3.265.16
7Command A 03 202564.95
8Kimi K2 Instruct (0905)63.73
9GLM-4.7 (Reasoning)63.61
10Command-R+63.49
11Fanar-C-2-27B63.16
12Qwen 3 235B A22B61.59
13Claude Opus 4.560.91
14MiniMax M3 (Reasoning)60.78
15AceGPT-v2-8B-Chat59.33

Interactive version: theaggregate.ai/benchmark?slug=balsam-translation-transliteration · How It Works · Data refreshed daily, snapshot 2026-09-19.