Korean LLM Eval - HAE-RAE Bench: leaderboard

Metric: Accuracy (%, 0-shot). Source: github.com. 8 models tracked.

Top models

#ModelScore
1Claude Opus 5 (Medium)95.84
2GPT-5.6 Sol (Medium)94.64
3GPT-5.6 Luna (Medium)93.17
4DeepSeek V4 Flash (0731) (Max)92.98
5GPT-5.6 Terra (Medium)92.85
6Claude Sonnet 5 (Medium)92
7DeepSeek V4 Flash (0731) (High)91.87
8DeepSeek V4 Flash (0731) (Non-reasoning)84.92

Interactive version: theaggregate.ai/benchmark?slug=korean-llm-eval-hae-rae-bench · How It Works · Data refreshed daily, snapshot 2026-09-19.