WritingBench: leaderboard

Generative writing benchmark covering writing quality, style control, factuality, and instruction following across writing tasks.

Metric: Score (%). Source: llm-stats.com. Status: saturated. 15 models tracked.

Top models

#ModelScore
1Qwen 3 235B A22B 2507 (Thinking)88.3
2Qwen 3 Next 80B A3B Instruct87.3
3Qwen 3 VL 235B A22B (Thinking)86.7
4Qwen 3 VL 32B (Thinking)86.2
5Qwen 3 VL 235B A22B Instruct85.5
6Qwen 3 VL 8B (Thinking)85.5
7Qwen 3 235B A22B 2507 Instruct85.2
8Qwen 3 VL 30B A3B (Thinking)85.2
9Qwen 3 Next 80B A3B (Thinking)84.6
10Qwen 3 VL 4B (Thinking)84
11Qwen 3 VL 8B Instruct83.1
12Qwen 3 VL 32B Instruct82.9
13Qwen 3 VL 30B A3B Instruct82.6
14Qwen 3 VL 4B Instruct82.5

Interactive version: theaggregate.ai/benchmark?slug=writingbench · How It Works · Data refreshed daily, snapshot 2026-09-05.