TRACE Bench - Character Consistency: leaderboard

Metric: Checklist completion rate (%). Source: arxiv.org. 26 models tracked.

Top models

#ModelScore
1Gemma 4 31B (Non-reasoning)95.46
2MiMo-V2.5-Pro94.95
3Claude Sonnet 4.694.68
4Qwen 3.5 27B (Non-reasoning)94.53
5GPT-5.594.42
6Kimi K2.5 (Non-reasoning)94.25
7MiniMax-M2.794
8MiMo-V2.593.94
9GLM-5 (Non-reasoning)93.94
10DeepSeek V4 Pro (Non-reasoning)93.56
11DeepSeek V4 Flash91.81
12Qwen 3 14B (Non-reasoning)88.36
13Ministral 3 14B87.82
14Mistral Small 3.287.57
15Qwen 3 8B (Non-reasoning)85.44

Interactive version: theaggregate.ai/benchmark?slug=trace-bench-character-consistency · How It Works · Data refreshed daily, snapshot 2026-09-19.