OpenCompass LLM - Language (CompassBench 2601): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 26 models tracked.

Top models

#ModelScore
1Qwen 3 Max (2026-01-23)89.4
2GPT-OSS-120B (High)87.8
3Kimi K2 (Thinking)87.4
4Kimi K2.587.3
5O3 (2025-04-16) (High)86.4
6Claude Opus 4.5 (Thinking)85.3
7Claude Sonnet 4.5 (Thinking)85.1
8Qwen 3 235B A22B 2507 (Thinking)84.7
9O4 Mini (2025-04-16) (High)84.3
10ERNIE 5.083.6
11Ring-1T83.4
12Gemini 3 Pro (Preview)82.8
13GPT-5.2 (High)82.3
14Tencent HY 2.0 Think82.2
15GLM-4.781.8

Interactive version: theaggregate.ai/benchmark?slug=opencompass-llm-language-compassbench-2601 · How It Works · Data refreshed daily, snapshot 2026-09-19.