OpenCompass LLM - Language (CompassBench 2510): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 27 models tracked.

Top models

#ModelScore
1GPT-OSS-120B (High)89.3
2GPT-5 (Thinking)89.2
3O3 (2025-04-16) (High)89.1
4Qwen 3 235B A22B 2507 (Thinking)88.4
5Grok 486.5
6O4 Mini (2025-04-16) (High)86.3
7DeepSeek R1 052883.6
8Gemini 2.5 Pro83.5
9Nanbeige3.5-Pro (Thinking)82.6
10Hunyuan-T1-2025082282.2
11Seed-OSS-36B-Instruct81.9
12GLM-4.681.7
13Qwen 3 Next 80B A3B (Thinking)81.2
14Ling-1T81.2
15DeepSeek V3.2 Exp80.8

Interactive version: theaggregate.ai/benchmark?slug=opencompass-llm-language-compassbench-2510 · How It Works · Data refreshed daily, snapshot 2026-09-19.