TRACE Bench - Overall: leaderboard

Metric: Weighted overall score (%). Source: arxiv.org. 26 models tracked.

Top models

#ModelScore
1Gemma 4 31B (Non-reasoning)96.02
2GPT-5.595.3
3Claude Sonnet 4.694.72
4MiMo-V2.594.43
5Kimi K2.5 (Non-reasoning)94.31
6MiMo-V2.5-Pro93.98
7DeepSeek V4 Pro (Non-reasoning)93.96
8MiniMax-M2.793.88
9DeepSeek V4 Flash92.79
10GLM-5 (Non-reasoning)92.28
11Qwen 3.5 27B (Non-reasoning)92.1
12Qwen 3 14B (Non-reasoning)90.62
13Qwen 3 8B (Non-reasoning)88.43
14Mistral Small 3.285.71
15Ministral 3 14B78.55

Interactive version: theaggregate.ai/benchmark?slug=trace-bench-overall · How It Works · Data refreshed daily, snapshot 2026-09-19.