OpenCompass Reasoning - Common Sense - English (CompassBench 2411): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 34 models tracked.

Top models

#ModelScore
1O1 Mini (2024-09-12)77.1
2Yi Lightning67.8
3GLM-4 Plus66
4Step 2 16K65.5
5TeleChat265.2
6Grok Beta64.6
7Qwen 2.5 72B Instruct63.2
8Yi 1.5 34B Chat57.9
9Claude 3.5 Sonnet (20241022)57.5
10Gemma 2 27B (IT)57
11Mistral Large 2 (Nov) Instruct (2411)57
12Mistral-Small-Instruct-240956.1
13GPT-4o (2024-11-20)55.9
14Yi-1.5-9B Chat55.6
15Qwen 2.5 7B Instruct55.1

Interactive version: theaggregate.ai/benchmark?slug=opencompass-reasoning-common-sense-english-compassbench-2411 · How It Works · Data refreshed daily, snapshot 2026-09-19.