BALSAM - Creative Writing: leaderboard

Metric: Overall score (0-100, LLM-judged generation and multiple choice). Source: benchmarks.ksaa.gov.sa. 29 models tracked.

Top models

#ModelScore
1Gemma 4 31B (IT)68.79
2GLM-5 (Thinking)54.57
3GLM-4.7 (Reasoning)52.76
4GPT-5.252.27
5Kimi K2 Instruct (0905)51.19
6Command A 03 202551.1
7DeepSeek V3.250.75
8Fanar-C-2-27B50.68
9MiniMax M3 (Reasoning)50.55
10AceGPT-v2-8B-Chat50.35
11Grok 4.1 Fast (Reasoning)49.89
12Llama 3.3 70B Instruct49.79
13Qwen 3 235B A22B49.54
14Llama 4 Maverick Instruct48.78
15Claude Opus 4.548.77

Interactive version: theaggregate.ai/benchmark?slug=balsam-creative-writing · How It Works · Data refreshed daily, snapshot 2026-09-19.