Creative Writing v3: leaderboard

32 creative-writing prompts run 3 times each (96 pieces) from Sam Paech's EQ-Bench (2025); an LLM judge scores a rubric per piece and ranks models by pairwise Elo, tracking slop.

Metric: Elo. Source: eqbench.com. Status: saturation imminent. 106 models tracked.

Top models

#ModelScore
1Claude Fable 52027.9
2Claude Opus 4.72015.8
3GPT-5.51861.3
4Claude Opus 4.81831.1
5GPT-5.41830.3
6Claude Sonnet 4.61790.5
7Claude Opus 4.61769.9
8GLM-5.21643.2
9GPT-5.21628.4
10Kimi K2.61618.7
11Claude Sonnet 4.51607.8
12GPT-5.31601.4
13Claude Opus 4.5 (20251101)1598.2
14O31584.2
15Kimi K21580.1

Interactive version: theaggregate.ai/benchmark?slug=creative-writing-v3 · How It Works · Data refreshed daily, snapshot 2026-09-05.