CompanionBench - English - Boundary & Safety: leaderboard

Metric: Mean judge score (1-10). Source: arxiv.org. 28 models tracked.

Top models

#ModelScore
1GPT-5.49.47
2Claude Sonnet 4.69.44
3GPT-5.59.44
4Claude Opus 4.89.4
5GPT-5.19.39
6DeepSeek V4 Pro9.39
7GLM-59.36
8Kimi K2.69.32
9Kimi K2.59.31
10GLM-5.19.31
11Qwen 3.7 Max9.31
12Gemma 4 31B (IT)9.28
13Qwen 3.5 397B A17B9.28
14GLM-5.29.28
15Qwen 3.5 122B A10B9.27

Interactive version: theaggregate.ai/benchmark?slug=companionbench-english-boundary-safety · How It Works · Data refreshed daily, snapshot 2026-09-19.