OpenCompass Reasoning - Social - English (CompassBench 2409): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 30 models tracked.

Top models

#ModelScore
1Claude 3.5 Sonnet (20240620)63.8
2Qwen 2.5 72B Instruct60.2
3Step 2 16K58.9
4Gemini 1.5 Pro57.3
5Mistral Nemo Instruct (2407)57.3
6GLM-4 Plus57.3
7Gemma 2 9B (IT)56.5
8Gemma 2 27B (IT)55
9Mistral Large 2 (Jul)54.4
10Llama 3.1 405B Instruct FP853.2
11Mistral-Small-Instruct-240952.6
12Llama 3.1 70B Instruct51.8
13GPT-4o (2024-05-13)49.7
14Qwen 2.5 7B Instruct48.4
15Yi-1.5-9B Chat46.9

Interactive version: theaggregate.ai/benchmark?slug=opencompass-reasoning-social-english-compassbench-2409 · How It Works · Data refreshed daily, snapshot 2026-09-19.