OpenCompass Reasoning - Humanities - English (CompassBench 2411): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 34 models tracked.

Top models

#ModelScore
1O1 Mini (2024-09-12)76.5
2Yi Lightning67.8
3Grok Beta64.4
4Qwen 2.5 72B Instruct60.6
5DeepSeek V2.560.6
6GPT-4o (2024-11-20)59
7GLM-4 Plus58.4
8Mistral Large 2 (Nov) Instruct (2411)58.1
9TeleChat257.5
10Step 2 16K51.5
11Yi 1.5 34B Chat51.1
12GPT-4o (2024-08-06)50
13Ministral-8B-Instruct-241049.8
14Llama 3.1 70B Instruct49.2
15Qwen 2.5 7B Instruct48.8

Interactive version: theaggregate.ai/benchmark?slug=opencompass-reasoning-humanities-english-compassbench-2411 · How It Works · Data refreshed daily, snapshot 2026-09-19.