OpenCompass Reasoning - Science and Engineering - Chinese (CompassBench 2409): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 30 models tracked.

Top models

#ModelScore
1GLM-4 Plus65
2Step 2 16K61.4
3DeepSeek V2.560.6
4GPT-4o (2024-05-13)58
5Qwen 2.5 72B Instruct57.7
6Claude 3.5 Sonnet (20240620)57.1
7Gemini 1.5 Pro56.1
8Mistral Large 2 (Jul)49.2
9Yi Large47.5
10Qwen 2.5 7B Instruct47.2
11GPT-4o (2024-08-06)47.1
12GPT-4o Mini (2024-07-18)45
13Gemma 2 27B (IT)43.3
14Mistral-Small-Instruct-240941.1
15Gemma 2 9B (IT)39.7

Interactive version: theaggregate.ai/benchmark?slug=opencompass-reasoning-science-and-engineering-chinese-compassbench-2409 · How It Works · Data refreshed daily, snapshot 2026-09-19.