Open Korean LLM Leaderboard — leaderboard
Korean language LLM evaluation across Ko-GPQA, Ko-Winogrande, Ko-GSM8K, Ko-EQ Bench, Ko-IFEval, and KorNAT tasks.
Metric: Average Score (%). Source: huggingface.co. Status: saturated. 1166 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Gemma-2-Ataraxy-Gemmasutra-9B-slerp | 825.4 |
| 2 | Gemma-2-9B-It-SPPO-Iter3 | 818.9 |
| 3 | recoilme-gemma-2-9B-v0.4 | 813.12 |
| 4 | Gemma-2-9B-It-SPPO-Iter1 | 809.48 |
| 5 | Gemma-2-9B-It-SPPO-Iter2 | 808.28 |
| 6 | Gemma 2 9B (IT) | 798.03 |
| 7 | Gemmasutra-9B-v1 | 795.55 |
| 8 | Qwen2.5-14B-Gutenberg-1e-Delta | 786.37 |
| 9 | qwen2.5-reinstruct-alternate-lumen-14B | 785.76 |
| 10 | ko-gemma-2-9B-it | 785.66 |
| 11 | Qwen2.5-Lumen-14B | 785.51 |
| 12 | SuperNova-Medius | 784.33 |
| 13 | Qwen2.5-14B-Gutenberg-Instruct-Slerpeno | 780.9 |
| 14 | recoilme-gemma-2-9B-v0.2 | 780.58 |
| 15 | gemma2-gutenberg-27B | 778.27 |
Interactive version: theaggregate.ai/benchmark?slug=open-korean-llm-leaderboard · How the rankings work · Data refreshed daily, snapshot 2026-07-22.