OpenCompass Language - NLP (CompassBench 2601): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 26 models tracked.

Top models

#ModelScore
1Qwen 3 Max (2026-01-23)88.6
2Qwen 3 235B A22B 2507 (Thinking)88.4
3GPT-OSS-120B (High)86.3
4Kimi K2 (Thinking)85.9
5Claude Opus 4.5 (Thinking)85.3
6Kimi K2.584.8
7GPT-5.2 (High)84.7
8Claude Sonnet 4.5 (Thinking)84.4
9Ring-1T83.8
10Qwen 3 Next 80B A3B (Thinking)83.6
11O3 (2025-04-16) (High)83.2
12MiniMax-M2.182.6
13Gemini 3 Pro (Preview)81.7
14O4 Mini (2025-04-16) (High)81.5
15Ling-1T81.3

Interactive version: theaggregate.ai/benchmark?slug=opencompass-language-nlp-compassbench-2601 · How It Works · Data refreshed daily, snapshot 2026-09-19.