EQ-Bench Creative Writing v3: leaderboard

LLM-judged creative writing benchmark measuring abilities, style, repetitiveness, and 'slop' (overused AI-typical phrases). Includes vocabulary and GPT-slop control metrics.

Metric: Elo. Source: eqbench.com. Status: saturation imminent. 106 models tracked.

Top models

#ModelScore
1Claude Fable 52027.9
2Claude Opus 4.72015.8
3GPT-5.51861.3
4Claude Opus 4.81831.1
5GPT-5.41830.3
6Claude Sonnet 4.61790.5
7Claude Opus 4.61769.9
8GLM-5.21643.2
9GPT-5.21628.4
10Kimi K2.61618.7
11Claude Sonnet 4.51607.8
12GPT-5.31601.4
13Claude Opus 4.5 (20251101)1598.2
14O31584.2
15Kimi K21580.1

Interactive version: theaggregate.ai/benchmark?slug=eq-bench-creative-writing-v3 · How It Works · Data refreshed daily, snapshot 2026-09-05.