CompanionBench - English - Calibrated Challenge: leaderboard

Metric: Mean judge score (1-10). Source: arxiv.org. 28 models tracked.

Top models

#ModelScore
1DeepSeek V4 Pro7.96
2Claude Opus 4.87.94
3GPT-5.57.93
4Claude Sonnet 4.67.82
5GLM-5.27.79
6GPT-5.47.78
7Qwen 3.5 397B A17B7.72
8Kimi K2.57.71
9GPT-5.17.7
10Qwen 3.7 Max7.7
11DeepSeek V4 Flash7.69
12Qwen 3 235B A22B 2507 Instruct7.69
13GLM-57.68
14GLM-5.17.67
15Kimi K2.67.59

Interactive version: theaggregate.ai/benchmark?slug=companionbench-english-calibrated-challenge · How It Works · Data refreshed daily, snapshot 2026-09-19.