OpenCompass Reasoning - Science and Engineering - Chinese (CompassBench 2411): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 34 models tracked.

Top models

#ModelScore
1GPT-4o (2024-11-20)69.5
2Yi Lightning68
3GLM-4 Plus67
4O1 Mini (2024-09-12)64.5
5Qwen 2.5 72B Instruct60.5
6DeepSeek V2.560.2
7360gpt2-pro59.6
8Grok Beta59
9Claude 3.5 Sonnet (20241022)57.8
10TeleChat257.4
11Mistral Large 2 (Nov) Instruct (2411)53.2
12Step 2 16K51.2
13GPT-4o (2024-08-06)50
14Gemma 2 27B (IT)44.2
15Qwen 2.5 7B Instruct43.9

Interactive version: theaggregate.ai/benchmark?slug=opencompass-reasoning-science-and-engineering-chinese-compassbench-2411 · How It Works · Data refreshed daily, snapshot 2026-09-19.