TRACE Bench - Language Quality: leaderboard

Metric: Per-turn LLM-judge language quality (%). Source: arxiv.org. 26 models tracked.

Top models

#ModelScore
1MiMo-V2.599.03
2MiMo-V2.5-Pro98.73
3DeepSeek V4 Flash98.58
4Claude Sonnet 4.698.16
5Kimi K2.5 (Non-reasoning)98.16
6GPT-5.597.87
7Gemma 4 31B (Non-reasoning)97.66
8DeepSeek V4 Pro (Non-reasoning)97.41
9Qwen 3 8B (Non-reasoning)97.27
10Qwen 3 14B (Non-reasoning)96.98
11Qwen 3.5 27B (Non-reasoning)96.59
12MiniMax-M2.796.53
13GLM-5 (Non-reasoning)95.51
14Mistral Small 3.290.77
15Hermes-4-14B84.91

Interactive version: theaggregate.ai/benchmark?slug=trace-bench-language-quality · How It Works · Data refreshed daily, snapshot 2026-09-19.