CompanionBench - English - IRT Theta: leaderboard

Metric: IRT theta (judge-severity-corrected, 1-10 scale). Source: arxiv.org. 28 models tracked.

Top models

#ModelScore
1GPT-5.58.27
2Claude Opus 4.88.24
3GPT-5.48.21
4DeepSeek V4 Pro8.06
5Claude Sonnet 4.68.04
6GLM-57.98
7Kimi K2.67.95
8GLM-5.17.94
9GPT-5.17.93
10Qwen 3.7 Max7.93
11Kimi K2.57.88
12GLM-5.27.86
13DeepSeek V4 Flash7.82
14Gemma 4 31B (IT)7.77
15Qwen 3.5 397B A17B7.77

Interactive version: theaggregate.ai/benchmark?slug=companionbench-english-irt-theta · How It Works · Data refreshed daily, snapshot 2026-09-19.