CompanionBench - English - Relational Continuity: leaderboard

Metric: Mean judge score (1-10). Source: arxiv.org. 28 models tracked.

Top models

#ModelScore
1GPT-5.58.33
2Claude Opus 4.88.3
3DeepSeek V4 Pro8.18
4GPT-5.48.14
5GPT-5.18.13
6Claude Sonnet 4.68.07
7Kimi K2.68.07
8GLM-5.18.01
9GLM-58
10Kimi K2.57.96
11Qwen 3.7 Max7.95
12GLM-5.27.95
13Qwen 3.5 397B A17B7.92
14Qwen 3 235B A22B 2507 Instruct7.9
15Qwen 3.5 122B A10B7.87

Interactive version: theaggregate.ai/benchmark?slug=companionbench-english-relational-continuity · How It Works · Data refreshed daily, snapshot 2026-09-19.