CompanionBench - English - Holding Ambiguity: leaderboard

Metric: Mean judge score (1-10). Source: arxiv.org. 28 models tracked.

Top models

#ModelScore
1Qwen 3.7 Max8.75
2GPT-5.48.58
3GPT-5.58.57
4Claude Opus 4.88.54
5DeepSeek V4 Pro8.54
6Qwen 3 235B A22B 2507 Instruct8.52
7Kimi K2.68.5
8Kimi K2.58.48
9Gemma 4 31B (IT)8.45
10DeepSeek V4 Flash8.41
11Qwen 3.5 122B A10B8.4
12Claude Sonnet 4.68.38
13GLM-5.18.37
14GLM-58.37
15GPT-4.18.34

Interactive version: theaggregate.ai/benchmark?slug=companionbench-english-holding-ambiguity · How It Works · Data refreshed daily, snapshot 2026-09-19.