Korean LLM Eval - KMMLU-HARD — leaderboard

Metric: Accuracy (%, 0-shot). Source: github.com. 23 models tracked.

Top models

#ModelScore
1GPT-5.2 (Medium)74.63
2GPT-5.1 (Medium)72.76
3GPT-5 Mini60.61
4GPT-5 Nano51.72
5GPT-5.251.1
6GPT-5.143.9
7GPT-4.142.79
8GPT-5 Chat42.12
9GPT-5.1 ChatGPT40.83
10GPT-4o39.62
11GPT-4.1 Mini35.6
12GPT-4 Turbo30.56
13Phi-3.5-MoE-instruct25.34
14Phi-4 Mini Instruct25.27
15GPT-4o Mini24.56

Interactive version: theaggregate.ai/benchmark?slug=korean-llm-eval-kmmlu-hard · How It Works · Data refreshed daily, snapshot 2026-07-27.