TRACE Bench - Diversity: leaderboard

Metric: Normalized repetition-penalty score (%). Source: arxiv.org. 26 models tracked.

Top models

#ModelScore
1DeepSeek V4 Pro (Non-reasoning)95.43
2Gemma 4 31B (Non-reasoning)93.49
3GPT-5.592.58
4Claude Sonnet 4.692.22
5DeepSeek V4 Flash91.79
6Ministral 3 14B90.11
7Qwen 3.5 27B (Non-reasoning)89.48
8Kimi K2.5 (Non-reasoning)88.7
9GLM-5 (Non-reasoning)88.24
10MiniMax-M2.787.82
11MiMo-V2.5-Pro87.59
12MiMo-V2.586.62
13Qwen 3.5 2B (Non-reasoning)78.61
14Qwen 3 14B (Non-reasoning)74.76
15L3-8B-Stheno-v3.267.76

Interactive version: theaggregate.ai/benchmark?slug=trace-bench-diversity · How It Works · Data refreshed daily, snapshot 2026-09-19.