Open Korean LLM Leaderboard — leaderboard

Korean language LLM evaluation across Ko-GPQA, Ko-Winogrande, Ko-GSM8K, Ko-EQ Bench, Ko-IFEval, and KorNAT tasks.

Metric: Average Score (%). Source: huggingface.co. Status: saturated. 1166 models tracked.

Top models

#ModelScore
1Gemma-2-Ataraxy-Gemmasutra-9B-slerp825.4
2Gemma-2-9B-It-SPPO-Iter3818.9
3recoilme-gemma-2-9B-v0.4813.12
4Gemma-2-9B-It-SPPO-Iter1809.48
5Gemma-2-9B-It-SPPO-Iter2808.28
6Gemma 2 9B (IT)798.03
7Gemmasutra-9B-v1795.55
8Qwen2.5-14B-Gutenberg-1e-Delta786.37
9qwen2.5-reinstruct-alternate-lumen-14B785.76
10ko-gemma-2-9B-it785.66
11Qwen2.5-Lumen-14B785.51
12SuperNova-Medius784.33
13Qwen2.5-14B-Gutenberg-Instruct-Slerpeno780.9
14recoilme-gemma-2-9B-v0.2780.58
15gemma2-gutenberg-27B778.27

Interactive version: theaggregate.ai/benchmark?slug=open-korean-llm-leaderboard · How the rankings work · Data refreshed daily, snapshot 2026-07-22.