Multilingual MMLU - Chinese — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 17 models tracked.

Top models

#ModelScore
1Claude 3.5 Sonnet78.41
2Qwen 2 72B Instruct77.45
3Qwen 2.5 72B Instruct76.71
4Llama 3.1 70B Instruct74.79
5Llama 3 70B Instruct69.5
6GPT-4o Mini65.92
7Qwen 2.5 7B Instruct64.44
8aya-expanse-32B63.41
9Qwen 2 7B Instruct61.78
10Llama 3.1 8B Instruct55.52
11aya-23-35B54.06
12aya-expanse-8B52.52
13Llama 3 8B Instruct51.42
14aya-23-8B45.7

Interactive version: theaggregate.ai/benchmark?slug=multilingual-mmlu-chinese · How the rankings work · Data refreshed daily, snapshot 2026-07-22.