OpenCompass LLM - Reasoning (CompassBench 2411): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 34 models tracked.

Top models

#ModelScore
1O1 Mini (2024-09-12)70.2
2GPT-4o (2024-11-20)61.4
3Yi Lightning58.9
4Grok Beta58.6
5Claude 3.5 Sonnet (20241022)57.2
6GLM-4 Plus56.4
7Qwen 2.5 72B Instruct56.2
8Mistral Large 2 (Nov) Instruct (2411)56
9Step 2 16K55.8
10GPT-4o (2024-08-06)54.5
11DeepSeek V2.552.7
12360gpt2-pro52.2
13TeleChat252.2
14Llama 3.1 405B Instruct FP850.2
15Gemma 2 27B (IT)49

Interactive version: theaggregate.ai/benchmark?slug=opencompass-llm-reasoning-compassbench-2411 · How It Works · Data refreshed daily, snapshot 2026-09-19.