Korean LLM Eval - KMMLU — leaderboard

Metric: Accuracy (%, 0-shot). Source: github.com. 21 models tracked.

Top models

#ModelScore
1GPT-5.1 (Medium)83.73
2GPT-5 Mini76.47
3GPT-5.271.54
4GPT-5 Nano69.28
5GPT-5 Chat65.92
6GPT-5.165.9
7GPT-4.165.49
8GPT-4o64.26
9GPT-5.1 ChatGPT63.11
10GPT-4.1 Mini59.26
11GPT-4 Turbo58.75
12GPT-4o Mini52.63
13Phi-450.3
14GPT-4.1 Nano48.57
15Phi-3.5-MoE-instruct47.43

Interactive version: theaggregate.ai/benchmark?slug=korean-llm-eval-kmmlu · How It Works · Data refreshed daily, snapshot 2026-07-27.