CompanionBench - English - Emotion Regulation: leaderboard

Metric: Mean judge score (1-10). Source: arxiv.org. 28 models tracked.

Top models

#ModelScore
1GPT-5.47.36
2GPT-5.57.34
3Claude Opus 4.87.33
4DeepSeek V4 Pro7.18
5GPT-5.17.14
6Qwen 3.7 Max7.14
7GLM-5.27.07
8Kimi K2.57.05
9GLM-5.17.03
10GLM-57.01
11Claude Sonnet 4.66.99
12DeepSeek V4 Flash6.95
13Kimi K2.66.9
14Qwen 3.5 122B A10B6.89
15Gemma 4 31B (IT)6.87

Interactive version: theaggregate.ai/benchmark?slug=companionbench-english-emotion-regulation · How It Works · Data refreshed daily, snapshot 2026-09-19.