TRACE Bench - Length: leaderboard

Metric: Reply-length compliance (%). Source: arxiv.org. 26 models tracked.

Top models

#ModelScore
1Qwen 3 14B (Non-reasoning)99.6
2Gemma 4 31B (Non-reasoning)98.49
3Qwen 3 8B (Non-reasoning)98.32
4GPT-5.596.54
5MiniMax-M2.794.93
6MiMo-V2.594.59
7Kimi K2.5 (Non-reasoning)94.06
8Claude Sonnet 4.693.7
9Mistral Small 3.291.44
10DeepSeek V4 Pro (Non-reasoning)91.42
11MiMo-V2.5-Pro88.75
12DeepSeek V4 Flash88.7
13GLM-5 (Non-reasoning)86.38
14Qwen 3.5 27B (Non-reasoning)81.41
15Hermes-4-14B76.7

Interactive version: theaggregate.ai/benchmark?slug=trace-bench-length · How It Works · Data refreshed daily, snapshot 2026-09-19.