WritingBench — leaderboard

Generative writing benchmark covering writing quality, style control, factuality, and instruction following across diverse writing tasks.

Metric: Score (self-reported). Source: benchmarklist.com. Status: saturated. 53 models tracked.

Top models

#ModelScore
1GPT-583.87
2Claude Sonnet 4.580.71
3O380.46
4Qwen 3 235B A22B 2507 Instruct80.26
5Claude Opus 4.579.78
6Gemini 2.5 Pro79.26
7Nanbeige4-3B-Thinking-251179.03
8DeepSeek R1 052878.92
9doubao-seed-1.6-thinking-25061578.76
10Claude Haiku 4.577.09
11Claude Opus 4.176.36
12Claude Opus 4 (20250514) (Thinking)75.12
13Qwen 3 235B A22B (Thinking)74.73
14Grok 474.65
15Claude Opus 474.45

Interactive version: theaggregate.ai/benchmark?slug=writingbench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.