Creative Writing (Lechmazur) — leaderboard

Evaluates creative fiction writing quality across 30+ models using structured prompts and LLM-as-judge scoring. Measures prose quality, creativity, coherence, and adherence to constraints.

Metric: Mean Score. Source: github.com. Status: saturation imminent. 39 models tracked.

Top models

#ModelScore
1Claude Fable 5 (High)3.3
2GPT-5.5 (xHigh)3
3Kimi K32.9
4GPT-5.6 Sol (xHigh)2.9
5GPT-5.4 (xHigh)2.7
6GPT-5.6 Sol (High)2.7
7GPT-5.4 (Medium)2.7
8Claude Opus 4.72.4
9Claude Opus 4.8 (xHigh)1.3
10GPT-5.2 (Medium)1
11GLM-5.2 (Max)0.9
12Claude Opus 4.8 (High)0.8
13Kimi K2.60.7
14MiniMax-M30.6
15Mistral Medium 3.10.2

Interactive version: theaggregate.ai/benchmark?slug=creative-writing-lechmazur · How the rankings work · Data refreshed daily, snapshot 2026-07-22.