CompanionBench - English - Selfobject Responsiveness: leaderboard

Metric: Mean judge score (1-10). Source: arxiv.org. 28 models tracked.

Top models

#ModelScore
1GPT-5.58.38
2Claude Opus 4.88.35
3DeepSeek V4 Pro8.26
4GPT-5.48.23
5Claude Sonnet 4.68.14
6GPT-5.18.14
7Qwen 3.7 Max8.12
8GLM-58.11
9Qwen 3 235B A22B 2507 Instruct8.09
10Kimi K2.68.08
11GLM-5.18.04
12DeepSeek V4 Flash8.02
13Qwen 3.5 397B A17B8.01
14GLM-5.28
15Kimi K2.57.99

Interactive version: theaggregate.ai/benchmark?slug=companionbench-english-selfobject-responsiveness · How It Works · Data refreshed daily, snapshot 2026-09-19.