OpenCompass Reasoning - Complex (CompassBench 2411): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 34 models tracked.

Top models

#ModelScore
1O1 Mini (2024-09-12)70.3
2GPT-4o (2024-11-20)59.6
3GPT-4o (2024-08-06)59
4Claude 3.5 Sonnet (20241022)58.6
5Mistral Large 2 (Nov) Instruct (2411)55.9
6Step 2 16K55.7
7Llama 3.1 405B Instruct FP854.1
8Grok Beta53.2
9Llama 3.1 70B Instruct51
10Qwen 2.5 72B Instruct50.4
11Yi Lightning49.8
12Gemma 2 27B (IT)49.7
13360gpt2-pro48.8
14GLM-4 Plus48.3
15Mistral-Small-Instruct-240946.7

Interactive version: theaggregate.ai/benchmark?slug=opencompass-reasoning-complex-compassbench-2411 · How It Works · Data refreshed daily, snapshot 2026-09-19.