BALSAM - Text Classification: leaderboard

Metric: Overall score (0-100, LLM-judged generation and multiple choice). Source: benchmarks.ksaa.gov.sa. 29 models tracked.

Top models

#ModelScore
1Gemma 4 31B (IT)47.19
2GPT-5.241.14
3GLM-5 (Thinking)40.62
4Grok 4.1 Fast (Reasoning)40.51
5Kimi K2 Instruct (0905)40.31
6Command A 03 202539.82
7Llama 3.3 70B Instruct39.46
8GLM-4.7 (Reasoning)39.28
9DeepSeek V3.239.04
10AceGPT-v2-8B-Chat38.43
11Qwen 3 235B A22B37.86
12Llama 4 Maverick Instruct37.39
13Command-R+37.24
14Claude Opus 4.537.17
15Jais-2-70B-Chat36.62

Interactive version: theaggregate.ai/benchmark?slug=balsam-text-classification · How It Works · Data refreshed daily, snapshot 2026-09-19.