Korean LLM Eval - HAE-RAE Bench — leaderboard

Metric: Accuracy (%, 0-shot). Source: github.com. 23 models tracked.

Top models

#ModelScore
1GPT-5.2 (Medium)91.81
2GPT-5.1 (Medium)90.65
3GPT-5.286.93
4GPT-4.185.83
5GPT-4o85.7
6GPT-5.184.52
7GPT-5 Mini84.35
8GPT-5 Chat84.32
9GPT-5.1 ChatGPT83.22
10GPT-4.1 Mini78.93
11GPT-5 Nano78.6
12GPT-4 Turbo77.76
13GPT-4o Mini76.4
14GPT-4.1 Nano67.95
15Phi-3.5-MoE-instruct61.83

Interactive version: theaggregate.ai/benchmark?slug=korean-llm-eval-hae-rae-bench · How It Works · Data refreshed daily, snapshot 2026-07-27.