CompanionBench - English - Positive Resonance: leaderboard

Metric: Mean judge score (1-10). Source: arxiv.org. 28 models tracked.

Top models

#ModelScore
1GPT-5.58.29
2GPT-5.18.19
3Claude Opus 4.88.1
4GPT-5.48.09
5DeepSeek V4 Pro8.06
6Qwen 3.7 Max8.03
7Claude Sonnet 4.67.98
8Qwen 3 235B A22B 2507 Instruct7.95
9GLM-5.17.91
10Qwen 3.5 397B A17B7.9
11Qwen 3.5 122B A10B7.89
12GLM-5.27.89
13GLM-57.88
14Kimi K2.67.81
15Qwen 3.5 35B A3B7.8

Interactive version: theaggregate.ai/benchmark?slug=companionbench-english-positive-resonance · How It Works · Data refreshed daily, snapshot 2026-09-19.