OpenCompass Reasoning - Humanities - English (CompassBench 2409): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 30 models tracked.

Top models

#ModelScore
1Qwen 2.5 72B Instruct63.8
2Step 2 16K62.3
3Claude 3.5 Sonnet (20240620)61
4DeepSeek V2.561
5GLM-4 Plus58
6GPT-4o (2024-05-13)56.2
7Mistral Large 2 (Jul)51.9
8Mistral Nemo Instruct (2407)50.2
9Llama 3.1 70B Instruct50
10Llama 3.1 405B Instruct FP849.5
11GPT-4o Mini (2024-07-18)49.3
12GPT-4o (2024-08-06)48.6
13Mistral-Small-Instruct-240947.5
14Gemini 1.5 Pro47.2
15Qwen 2.5 7B Instruct45.9

Interactive version: theaggregate.ai/benchmark?slug=opencompass-reasoning-humanities-english-compassbench-2409 · How It Works · Data refreshed daily, snapshot 2026-09-19.