CompanionBench - Chinese - IRT Theta: leaderboard

Metric: IRT theta (judge-severity-corrected, 1-10 scale). Source: arxiv.org. 28 models tracked.

Top models

#ModelScore
1GPT-5.58.34
2GPT-5.48.21
3Claude Opus 4.88.16
4DeepSeek V4 Pro8.15
5GPT-5.18.05
6GLM-5.17.96
7Claude Sonnet 4.67.92
8Qwen 3.5 397B A17B7.92
9Qwen 3.7 Max7.92
10GLM-57.89
11Kimi K2.67.85
12GLM-5.27.78
13Gemma 4 31B (IT)7.77
14Kimi K2.57.62
15DeepSeek V4 Flash7.59

Interactive version: theaggregate.ai/benchmark?slug=companionbench-chinese-irt-theta · How It Works · Data refreshed daily, snapshot 2026-09-19.