OpenCompass LLM - Reasoning (CompassBench 2405): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 39 models tracked.

Top models

#ModelScore
1GPT-4 Turbo52.1
2GPT-4o (2024-05-13)47.8
3Yi Large46.8
4GLM-444
5Claude 3 Opus42.9
6DeepSeek V2 Chat41.5
7Qwen 1.5 32B Chat41.3
8Yi 1.5 34B Chat40.4
9Qwen 1.5 72B Chat40.3
10Llama 3 70B Instruct39.7
11Yi-1.5-9B Chat39.7
12Moonshot v1 8K39.1
13Qwen 1.5 14B Chat38.6
14Qwen 1.5 110B Chat37.5
15Mistral Large37.4

Interactive version: theaggregate.ai/benchmark?slug=opencompass-llm-reasoning-compassbench-2405 · How It Works · Data refreshed daily, snapshot 2026-09-19.