YapBench: leaderboard

Measures LLM verbosity on brevity-ideal prompts. Models are scored on excess length beyond a minimal baseline answer using YapScore and YapIndex metrics.

Metric: YapIndex (lower is better). Source: huggingface.co. Status: years away from saturation. 108 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol18.5
2GPT-3.5 Turbo22.7
3GPT-5.6 Luna27.8
4GPT-5.440.7
5Kimi K2 090544.7
6GPT-451.2
7GPT-5.3 Codex64.8
8GLM-4.7 Flash65
9GLM-4.768.7
10Grok 4 Fast70.2
11Kimi K2.7 Code72
12GPT-4.1 Mini75.7
13GLM-5.276.5
14Grok 4.583.8
15GPT-5.1 Codex85.3

Interactive version: theaggregate.ai/benchmark?slug=yapbench · How It Works · Data refreshed daily, snapshot 2026-09-05.