Multilingual MMLU - Korean — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 17 models tracked.

Top models

#ModelScore
1Claude 3.5 Sonnet78.95
2Llama 3.1 70B Instruct72.74
3Qwen 2 72B Instruct72.35
4Qwen 2.5 72B Instruct71.78
5Llama 3 70B Instruct64.51
6GPT-4o Mini63.55
7aya-expanse-32B62.43
8Qwen 2.5 7B Instruct59.31
9Qwen 2 7B Instruct53.98
10aya-23-35B53.7
11Llama 3.1 8B Instruct50.78
12aya-expanse-8B50.67
13Llama 3 8B Instruct46.54
14aya-23-8B43.64

Interactive version: theaggregate.ai/benchmark?slug=multilingual-mmlu-korean · How the rankings work · Data refreshed daily, snapshot 2026-07-22.