OpenCompass Language - Creation (CompassBench 2601): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 26 models tracked.

Top models

#ModelScore
1GPT-OSS-120B (High)93.7
2O3 (2025-04-16) (High)92.5
3Qwen 3 Max (2026-01-23)92.3
4Claude Sonnet 4.5 (Thinking)92.1
5Kimi K2.591.1
6Claude Opus 4.5 (Thinking)91
7Kimi K2 (Thinking)90.6
8Ring-1T90.4
9O4 Mini (2025-04-16) (High)88.9
10Ling-1T88
11Qwen 3 235B A22B 2507 (Thinking)87.5
12Tencent HY 2.0 Think86.3
13Grok 4.186
14DeepSeek V3.284.5
15Seed-OSS-36B-Instruct83.9

Interactive version: theaggregate.ai/benchmark?slug=opencompass-language-creation-compassbench-2601 · How It Works · Data refreshed daily, snapshot 2026-09-19.