CompanionBench - English - Emotion Understanding: leaderboard

Metric: Mean judge score (1-10). Source: arxiv.org. 28 models tracked.

Top models

#ModelScore
1GPT-5.58.61
2GPT-5.48.57
3Claude Opus 4.88.54
4DeepSeek V4 Pro8.45
5Claude Sonnet 4.68.36
6GLM-58.36
7GPT-5.18.34
8Qwen 3.5 397B A17B8.32
9Kimi K2.68.31
10Qwen 3.7 Max8.31
11Kimi K2.58.27
12GLM-5.18.27
13Qwen 3 235B A22B 2507 Instruct8.26
14Qwen 3.5 122B A10B8.22
15GLM-5.28.2

Interactive version: theaggregate.ai/benchmark?slug=companionbench-english-emotion-understanding · How It Works · Data refreshed daily, snapshot 2026-09-19.