OpenCompass Language - Creation - English (CompassBench 2510): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 27 models tracked.

Top models

#ModelScore
1GPT-5 (Thinking)95
2GPT-OSS-120B (High)94.9
3O3 (2025-04-16) (High)94.8
4Grok 493.9
5Qwen 3 235B A22B 2507 (Thinking)93.7
6O4 Mini (2025-04-16) (High)93.5
7Claude Sonnet 4.5 (Thinking)89.7
8Gemini 2.5 Pro88.4
9GLM-4.687.6
10DeepSeek V3.2 Exp87.1
11Claude Haiku 4.5 (Thinking)87
12Seed-OSS-36B-Instruct87
13Nanbeige3.5-Pro (Thinking)86.9
14Kimi K2 090585.7
15DeepSeek R1 052884.6

Interactive version: theaggregate.ai/benchmark?slug=opencompass-language-creation-english-compassbench-2510 · How It Works · Data refreshed daily, snapshot 2026-09-19.