CompanionBench - English - Emotion Recognition: leaderboard

Metric: Mean judge score (1-10). Source: arxiv.org. 28 models tracked.

Top models

#ModelScore
1GPT-5.58.75
2GPT-5.48.74
3Claude Opus 4.88.74
4DeepSeek V4 Pro8.67
5GPT-5.18.66
6Claude Sonnet 4.68.61
7GLM-58.59
8Kimi K2.68.58
9GLM-5.18.54
10Kimi K2.58.53
11Qwen 3.7 Max8.52
12Qwen 3 235B A22B 2507 Instruct8.5
13Qwen 3.5 397B A17B8.49
14GLM-5.28.47
15Qwen 3.5 122B A10B8.44

Interactive version: theaggregate.ai/benchmark?slug=companionbench-english-emotion-recognition · How It Works · Data refreshed daily, snapshot 2026-09-19.