CompanionBench - English - Emotional Validation: leaderboard

Metric: Mean judge score (1-10). Source: arxiv.org. 28 models tracked.

Top models

#ModelScore
1GPT-5.58.74
2Claude Opus 4.88.71
3GPT-5.48.7
4DeepSeek V4 Pro8.66
5GPT-5.18.57
6GLM-58.57
7Qwen 3.7 Max8.57
8Claude Sonnet 4.68.56
9Kimi K2.68.55
10Kimi K2.58.53
11Qwen 3 235B A22B 2507 Instruct8.52
12Qwen 3.5 397B A17B8.49
13GLM-5.18.44
14DeepSeek V4 Flash8.44
15GLM-5.28.43

Interactive version: theaggregate.ai/benchmark?slug=companionbench-english-emotional-validation · How It Works · Data refreshed daily, snapshot 2026-09-19.