EQ-Bench Creative Writing v3 — leaderboard

LLM-judged creative writing benchmark measuring abilities, style, repetitiveness, and 'slop' (overused AI-typical phrases). Includes vocabulary and GPT-slop control metrics.

Metric: Elo. Source: eqbench.com. Status: saturation imminent. 106 models tracked.

Top models

#ModelScore
1Claude Fable 52027.9
2Claude Opus 4.72015.8
3GPT-5.51861.3
4Claude Opus 4.81831.1
5GPT-5.41830.3
6Claude Sonnet 4.61790.5
7Claude Opus 4.61769.9
8GLM-5.21643.2
9GPT-5.21628.4
10Kimi K2.61618.7
11Claude Sonnet 4.51607.8
12Claude Opus 4.5 (20251101)1598.2
13O31584.2
14Kimi K21580.1
15GPT-5.4 Mini1566.7

Interactive version: theaggregate.ai/benchmark?slug=eq-bench-creative-writing-v3 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.