CMMLU: leaderboard

11,528 four-option multiple-choice questions across 67 subjects in Chinese, from MBZUAI, LibrAI and Shanghai Jiao Tong University (2023); accuracy, with a random baseline of 25%.

Metric: 5-shot Avg Accuracy (%). Source: github.com. Status: saturated. 42 models tracked.

Top models

#ModelScore
1Qwen 2 72B89.65
2Qwen 1.5 110B88.32
3Qwen 2.5 72B85.67
4Qwen 1.5 72B83.54
5Qwen 1.5 32B82.25
6Qwen 1.5 7B72.5
7XuanYuan-70B71.1
8GPT-470.95
9Llama 3.1 70B Instruct64.38
10Qwen-7B58.66
11ChatGLM2 6B48.8
12falcon-40B41.45
13LLaMA-65B39.8
14Llama 3 70B Instruct36.85

Interactive version: theaggregate.ai/benchmark?slug=cmmlu · How It Works · Data refreshed daily, snapshot 2026-09-05.